연구자들은 생물학, 물리학, 화학 분야의 전문가들이 작성한 448개의 다중 선택 질문으로 구성된 도전적인 데이터셋 GPQA를 제시합니다. 이 벤치마크는 극도로 어렵도록 설계되었으며, 박사 수준의 전문가도 정확도 65%만 달성하고, 숙련된 비전문가는 제한 없는 웹 접근 권한이 있음에도 불구하고 34%에 불과합니다. 최첨단 AI 시스템도 어려움을 겪고 있으며, 가장 강력한 GPT-4 기준선도 정확도 39%만 달성합니다. 인간과 프론티어 모델 모두에게 이러한 어려움은 과학 지식 발전에서 AI 출력을 감독하기 위한 현실적이고 확장 가능한 감독 실험을 가능하게 하는 것을 목표로 합니다.