Les chercheurs présentent GPQA, un ensemble de données difficile composé de 448 questions à choix multiples rédigées par des experts en biologie, physique et chimie. Le benchmark est conçu pour être extrêmement difficile ; les experts de niveau doctorat atteignent seulement 65% de précision, tandis que les non-experts qualifiés atteignent 34% même avec un accès web illimité. Les systèmes d'IA de pointe sont également en difficulté, la ligne de base GPT-4 la plus forte n'atteignant que 39% de précision. Cette difficulté pour les humains et les modèles de pointe vise à permettre des expériences de supervision réalistes et évolutives pour surveiller les sorties de l'IA dans le développement des connaissances scientifiques.