Para peneliti menyajikan GPQA, sebuah dataset menantang berisi 448 pertanyaan pilihan ganda yang ditulis oleh pakar di bidang biologi, fisika, dan kimia. Benchmark ini dirancang untuk sangat sulit; ahli tingkat PhD hanya mencapai akurasi 65%, sementara non-ahli terampil mencapai 34% bahkan dengan akses web tanpa batas. Sistem AI mutakhir juga kesulitan, dengan baseline GPT-4 terkuat hanya mencapai akurasi 39%. Kesulitan ini bagi manusia dan model terdepan bertujuan untuk memungkinkan eksperisi pengawasan yang realistis dan skalabel untuk mengawasi keluaran AI dalam pengembangan pengetahuan ilmiah.