Исследователи представляют GPQA — сложный набор из 448 вопросов с множественным выбором, составленных экспертами в области биологии, физики и химии. Этот бенчмарк разработан как чрезвычайно сложный: эксперты уровня PhD достигают точности лишь 65%, а квалифицированные не-эксперты — 34%, даже при наличии неограниченного доступа к интернету. Современные ИИ-системы также испытывают трудности, и сильнейшая базовая модель GPT-4 достигает точности всего 39%. Эта сложность как для людей, так и для передовых моделей направлена на проведение реалистичных масштабируемых экспериментов по надзору за выводами ИИ в процессе развития научных знаний.