Benchmark · reasoning

Humanity's Last Exam

39 条结果 30 个模型

Humanity's Last Exam(HLE)是一个由前沿、专家级问题组成的基准,涵盖众多学科领域(数学、自然科学、人文学科等),刻意设计得对 AI 极其困难。它以准确率(百分比)来衡量表现。

了解更多
示例
每道题都是只有唯一正确答案的封闭式专家级问题,例如一道高等数学题或研究生水平的科学题(有些附带图片),以多项选择或精确简答的形式给出。
评分方式
指标是准确率(accuracy),即模型答对题目的百分比。部分版本还会在准确率之外报告一项校准(置信度)指标。
验证方式
每道题都有已知的正确答案,模型的作答会自动与该参考答案比对(选择题看是否选对选项,简答题看是否匹配),属于客观的自动评分,而非人工投票。
为何重要
常见基准已趋于饱和(顶尖模型几乎触及上限),因此 HLE 力图成为一项处于人类专家知识前沿的高难度、有区分度的测试,用以衡量 AI 距离专家级推理还有多远。
示例解析
任务
蜂鸟(Apodiformes 目)独有一块双侧成对的卵形籽骨(sesamoid),嵌于 m. depressor caudae 肌止点处扩大的十字形腱膜(aponeurosis)的尾外侧部。这块籽骨支撑多少对(成对的)肌腱?请用一个整数作答。
解答
4
解析
该卵形籽骨在尾部降肌的十字形腱膜内形成,支撑该止点的四条成对肌腱——这是蜂鸟尾部解剖特有的一种特化骨化结构。HLE 通过将提交的整数与参考答案(4)精确匹配来评分,并单独采集置信度用于校准。
0 16.5 33 49.5 66 2025-01-23 2025-11-24 2026-09-25 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 Ornith-1.5 · 44.6 · 2026-08-19 Ornith-1.5 · 44.6 · 2026-08-20 GLM-5.3 · 42.3 · 2026-08-28 Claude Fable 5.1 · 60.9 · 2026-09-01 Gemini 3.8 Flash · 54.9 · 2026-09-02 DeepSeek-V4.1-Flash · 36.8 · 2026-09-10 Claude Opus 5.5 · 61.4 · 2026-09-25 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro Ornith-1.5 GLM-5.3 Claude Fable 5.1 Gemini 3.8 Flash DeepSeek-V4.1-Flash Claude Opus 5.5 DeepSeek R1 (text-only) Grok 4 GPT-5
时间线
日期 模型 得分 来源
2026-09-25 Claude Opus 5.5 61.4% Anthropic发布Claude Opus 5.5;TypeSafe推出Jev分类模型
2026-09-10 DeepSeek-V4.1-Flash 36.8% DeepSeek发布具有原生多模态支持的V4.1-Flash模型
2026-09-02 Gemini 3.8 Flash 54.9% 谷歌推出 Gemini 3.8 Flash 和 3.8 Flash Cyber
2026-09-01 Claude Fable 5.1 60.9% Anthropic 发布 Claude Fable 5.1,在 Terminal-Bench-Science 上取得 52.6% 的成绩,并降低缓存读取成本
2026-08-28 GLM-5.3 42.3% Z.ai微调GLM-5.3以提升网络安全能力
2026-08-20 Ornith-1.5 44.6% Z.ai提出后训练缩放定律并发布GLM 5.3;Ornith-1.5以自我改进能力上线
2026-08-19 Ornith-1.5 44.6% Ornith-1.5 发布具有自我改进训练功能的 9B、35B-A3B 和 397B 模型
2026-08-13 DeepSeek-V4-Pro 60.0% DeepSeek-V4-Pro GA 发布增强代理能力并添加 Responses API 支持
2026-08-03 Inkling-Small 31.6% Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
2026-07-23 PoTRE 49.92% PoTRE 引入异构多智能体框架以支持测试时推理
2026-07-06 Agents-A1 47.6pts 扩展视界而非参数量:以35B智能体实现万亿参数级性能
2026-07-01 Claude Opus 4.8 46.0% Anthropic 发布 Claude Opus 4.8,具备自适应推理和改进的诚实性
2026-06-09 Claude Fable 5 53.0% Claude Fable 5 在 Artificial Analysis Intelligence Index 上登顶
2026-04-25 Claude Opus 4.7 46.9% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-04-25 GPT-5.5 41.4% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-03-06 Claude Opus 4.6 53.0% Anthropic发布Claude Opus 4.6系统卡,详述能力与安全评估
2026-02-12 Gemini 3 Deep Think 48.4% Google 发布升级版 Gemini 3 Deep Think,附带新的基准测试成绩
2026-02-05 Claude Opus 4.6 53.0% Anthropic发布Claude Opus 4.6系统卡,详述能力与安全评估
2026-02-05 Claude Opus 4.6 40.0% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2026-01-29 Kimi K2.5 51.8% Moonshot发布Kimi K2.5多模态智能体模型
2025-11-18 Gemini 3 Pro 37.5% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Deep Think 41.0% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Pro 37.5% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Deep Think 41.0% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 引入开源研究代理的交互式扩展
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI 发布 Kimi K2 Thinking,一款拥有 1T 参数的开源推理模型
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek 发布 DeepSeek-V3.2-Exp,采用稀疏注意力机制提升长上下文效率
2025-09-16 Tongyi DeepResearch 32.9% 通义发布DeepResearch,开源网页代理性能媲美专有模型
2025-08-07 GPT-5 Pro 42.0% OpenAI 推出统一版 GPT-5,支持实时路由并提供免费访问
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI 发布 Grok 4,采用扩展强化学习与原生工具调用
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google在强劲基准测试结果推动下扩大Gemini 2.5 Pro访问权限
2025-03-26 Gemini 2.5 Pro 18.8% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind 发布 Gemini 2.5 Pro 实验模型
2025-03-25 Gemini 2.5 Pro 18.8% Google推出Gemini 2.5 Pro思维模型
2025-03-25 Gemini 2.5 Pro 18.8% Google 推出 Gemini 2.5 Pro 实验模型
2025-02-02 the model powering deep research 26.6% OpenAI在ChatGPT中推出深度研究功能,作为智能体能力
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam