Benchmark · reasoning

Humanity's Last Exam

32 条结果 24 个模型

Humanity's Last Exam(HLE)是一个由前沿、专家级问题组成的基准,涵盖众多学科领域(数学、自然科学、人文学科等),刻意设计得对 AI 极其困难。它以准确率(百分比)来衡量表现。

了解更多
示例
每道题都是只有唯一正确答案的封闭式专家级问题,例如一道高等数学题或研究生水平的科学题(有些附带图片),以多项选择或精确简答的形式给出。
评分方式
指标是准确率(accuracy),即模型答对题目的百分比。部分版本还会在准确率之外报告一项校准(置信度)指标。
验证方式
每道题都有已知的正确答案,模型的作答会自动与该参考答案比对(选择题看是否选对选项,简答题看是否匹配),属于客观的自动评分,而非人工投票。
为何重要
常见基准已趋于饱和(顶尖模型几乎触及上限),因此 HLE 力图成为一项处于人类专家知识前沿的高难度、有区分度的测试,用以衡量 AI 距离专家级推理还有多远。
示例解析
任务
蜂鸟(Apodiformes 目)独有一块双侧成对的卵形籽骨(sesamoid),嵌于 m. depressor caudae 肌止点处扩大的十字形腱膜(aponeurosis)的尾外侧部。这块籽骨支撑多少对(成对的)肌腱?请用一个整数作答。
解答
4
解析
该卵形籽骨在尾部降肌的十字形腱膜内形成,支撑该止点的四条成对肌腱——这是蜂鸟尾部解剖特有的一种特化骨化结构。HLE 通过将提交的整数与参考答案(4)精确匹配来评分,并单独采集置信度用于校准。
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
时间线
日期 模型 得分 来源
2026-08-13 DeepSeek-V4-Pro 60.0% DeepSeek-V4-Pro GA 发布增强代理能力并添加 Responses API 支持
2026-08-03 Inkling-Small 31.6% Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
2026-07-23 PoTRE 49.92% PoTRE 引入异构多智能体框架以支持测试时推理
2026-07-06 Agents-A1 47.6pts 扩展视界而非参数量:以35B智能体实现万亿参数级性能
2026-07-01 Claude Opus 4.8 46.0% Anthropic 发布 Claude Opus 4.8,具备自适应推理和改进的诚实性
2026-06-09 Claude Fable 5 53.0% Claude Fable 5 在 Artificial Analysis Intelligence Index 上登顶
2026-04-25 Claude Opus 4.7 46.9% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-04-25 GPT-5.5 41.4% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-03-06 Claude Opus 4.6 53.0% Anthropic发布Claude Opus 4.6系统卡,详述能力与安全评估
2026-02-12 Gemini 3 Deep Think 48.4% Google 发布升级版 Gemini 3 Deep Think,附带新的基准测试成绩
2026-02-05 Claude Opus 4.6 53.0% Anthropic发布Claude Opus 4.6系统卡,详述能力与安全评估
2026-02-05 Claude Opus 4.6 40.0% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2026-01-29 Kimi K2.5 51.8% Moonshot发布Kimi K2.5多模态智能体模型
2025-11-18 Gemini 3 Pro 37.5% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Deep Think 41.0% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Pro 37.5% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Deep Think 41.0% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 引入开源研究代理的交互式扩展
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI 发布 Kimi K2 Thinking,一款拥有 1T 参数的开源推理模型
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek 发布 DeepSeek-V3.2-Exp,采用稀疏注意力机制提升长上下文效率
2025-09-16 Tongyi DeepResearch 32.9% 通义发布DeepResearch,开源网页代理性能媲美专有模型
2025-08-07 GPT-5 Pro 42.0% OpenAI 推出统一版 GPT-5,支持实时路由并提供免费访问
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI 发布 Grok 4,采用扩展强化学习与原生工具调用
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google在强劲基准测试结果推动下扩大Gemini 2.5 Pro访问权限
2025-03-26 Gemini 2.5 Pro 18.8% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind 发布 Gemini 2.5 Pro 实验模型
2025-03-25 Gemini 2.5 Pro 18.8% Google推出Gemini 2.5 Pro思维模型
2025-03-25 Gemini 2.5 Pro 18.8% Google 推出 Gemini 2.5 Pro 实验模型
2025-02-02 the model powering deep research 26.6% OpenAI在ChatGPT中推出深度研究功能,作为智能体能力
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam