Pesquisadores apresentam o GPQA, um conjunto desafiador de 448 perguntas de múltipla escolha escritas por especialistas em biologia, física e química. O benchmark é projetado para ser extremamente difícil; especialistas de nível de doutorado alcançam apenas 65% de precisão, enquanto não especialistas qualificados atingem 34% mesmo com acesso ilimitado à web. Sistemas de IA de última geração também têm dificuldades, com a linha de base mais forte do GPT-4 alcançando apenas 39% de precisão. Essa dificuldade tanto para humanos quanto para modelos de fronteira visa permitir experimentos realistas e escaláveis de supervisão para monitorar as saídas da IA no desenvolvimento de conhecimento científico.