Benchmark · reasoning
Humanity's Last Exam
Humanity's Last Exam(HLE)是一个由前沿、专家级问题组成的基准,涵盖众多学科领域(数学、自然科学、人文学科等),刻意设计得对 AI 极其困难。它以准确率(百分比)来衡量表现。
了解更多
- 示例
- 每道题都是只有唯一正确答案的封闭式专家级问题,例如一道高等数学题或研究生水平的科学题(有些附带图片),以多项选择或精确简答的形式给出。
- 评分方式
- 指标是准确率(accuracy),即模型答对题目的百分比。部分版本还会在准确率之外报告一项校准(置信度)指标。
- 验证方式
- 每道题都有已知的正确答案,模型的作答会自动与该参考答案比对(选择题看是否选对选项,简答题看是否匹配),属于客观的自动评分,而非人工投票。
- 为何重要
- 常见基准已趋于饱和(顶尖模型几乎触及上限),因此 HLE 力图成为一项处于人类专家知识前沿的高难度、有区分度的测试,用以衡量 AI 距离专家级推理还有多远。
示例解析
任务
蜂鸟(Apodiformes 目)独有一块双侧成对的卵形籽骨(sesamoid),嵌于 m. depressor caudae 肌止点处扩大的十字形腱膜(aponeurosis)的尾外侧部。这块籽骨支撑多少对(成对的)肌腱?请用一个整数作答。
解答
4
解析
该卵形籽骨在尾部降肌的十字形腱膜内形成,支撑该止点的四条成对肌腱——这是蜂鸟尾部解剖特有的一种特化骨化结构。HLE 通过将提交的整数与参考答案(4)精确匹配来评分,并单独采集置信度用于校准。