研究者らは、生物学、物理学、化学の分野の専門家が作成した448問の多肢選択式問題からなる挑戦的なデータセットGPQAを発表しました。 このベンチマークは極めて困難になるように設計されており、博士課程レベルの専門家でも正答率は65%にとどまり、スキルのある非専門家でも unrestricted なウェブアクセスがあるにもかかわらず34%に留まります。最先端のAIシステムも苦戦しており、最も強力なGPT-4ベースラインでも正答率はわずか39%です。 人間とフロンティアモデルの両方にとってのこの難しさは、科学知識の発展におけるAI出力の監督のための現実的でスケーラブルな監視実験を可能にすることを目指しています。