研究人员提出了GPQA,这是一个具有挑战性的数据集,包含448道由生物学、物理学和化学领域专家编写的多项选择题。 该基准测试被设计为极其困难;博士级专家仅达到65%的准确率,而熟练的非专家即使拥有不受限制的网页访问权限,准确率也仅为34%。最先进的AI系统也面临困难,最强的GPT-4基线准确率仅为39%。 这种对人类和前沿模型都构成的难度旨在使监督AI在科学知识发展中的输出成为可能,从而实现现实且可扩展的监督实验。