Los investigadores presentan GPQA, un conjunto desafiante de 448 preguntas de opción múltiple escritas por expertos en biología, física y química. El benchmark está diseñado para ser extremadamente difícil; los expertos a nivel de doctorado logran solo un 65% de precisión, mientras que los no expertos cualificados alcanzan el 34% incluso con acceso ilimitado a la web. Los sistemas de IA de última generación también luchan, con la línea base más fuerte de GPT-4 logrando solo un 39% de precisión. Esta dificultad tanto para humanos como para modelos de vanguardia tiene como objetivo permitir experimentos realistas y escalables de supervisión para vigilar las salidas de la IA en el desarrollo de conocimientos científicos.