Benchmark · math

AIME 2025

31 条结果 27 个模型

AIME 2025 用 2025 年 American Invitational Mathematics Examination(一项高难度的高中数学竞赛)的 15 道题来测试模型的高级数学推理能力。每道题的答案都是 0 到 999 之间的整数,模型的得分是正确解出题目的百分比(通常以 pass@1 或 avg@k 的形式报告)。

了解更多
示例
典型题目是一道有挑战性的竞赛题——例如数论或组合数学问题——其答案是 0 到 999 之间的单个整数,比如求满足给定一组代数条件的有序数对的数量。
评分方式
15 道题中的每一道都按整数答案是否完全匹配来评分,得分即正确解出的比例(百分比);由于每次运行答案会有波动,结果通常在多次采样上取平均(avg@k)或以 pass@1 报告。
验证方式
验证是自动且客观的:将模型给出的最终整数与官方答案对照,没有部分分,也没有人工评判,因此只有数值完全匹配时解答才被接受。
为何重要
AIME 题目要求多步骤的创造性推理而非死记硬背,因此该基准是衡量前沿 LLM 数学能力的广受关注的指标,也是新推理模型发布时常见的醒目数据。
示例解析
任务
AIME 风格的代表性题目(答案是 0 到 999 之间的整数):求所有使 √(n² + 85n + 2017) 为整数的正整数 n 之和。
解答
配方:(2m)² − (2n+85)² = 843 = 3·281。分解平方差:(2m−2n−85)(2m+2n+85) = 843,得 n = 168 或 n = 27。和 = 168 + 27 = 195。
解析
配方将条件化为平方差 (2m)² − (2n+85)² = 843 = 3·281,其唯一的正因数分解给出 n = 168 和 n = 27,两者之和为 195。AIME 按唯一整数答案(0–999)的精确匹配评分,没有部分分。
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
时间线
日期 模型 得分 来源
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash:35B MoE 智能体模型通过训练后优化媲美更大规模模型
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash:35B MoE 智能体模型通过训练后优化媲美更大规模模型
2026-07-06 Agents-A1 79.0pts 扩展视界而非参数量:以35B智能体实现万亿参数级性能
2026-07-05 DASH 50.8% DASH通过分段级信用分配减少推理语言模型的过度思考
2026-05-14 o1-pro 86.0% OpenAI发布o1系列,以推理时计算确立推理时代
2026-01-27 Kimi K2.5 96.1% Moonshot发布搭载Agent Swarm技术的Kimi K2.5
2025-09-30 GLM-4.6 93.9% 智谱AI发布具备智能体能力和128k上下文窗口的GLM-4.6
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic 发布 Claude Sonnet 4.5,增强编码与智能体能力
2025-08-07 GPT-5 94.6% OpenAI 发布具备自适应推理与统一架构的 GPT-5
2025-08-07 GPT-5 94.6% OpenAI 推出 GPT-5,具备统一路由与专家级推理能力
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2:拥有1T参数和MuonClip优化器的开源MoE模型
2025-07-28 Kimi K2 49.5% Moonshot发布Kimi K2,一款拥有32B激活参数的开放智能体MoE模型
2025-07-25 Grok 4 88.0% Epoch AI 评估 Grok 4 的数学能力
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 提升推理能力与 AIME 准确率达 87.5%
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 引入统一思维模式并支持 119 种语言
2025-04-17 o4-mini 92.7% OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2025-04-16 OpenAI o3 98.4% OpenAI 发布 o3 和 o4-mini 推理模型,支持智能体工具调用
2025-04-16 OpenAI o4-mini 99.5% OpenAI 发布 o3 和 o4-mini 推理模型,支持智能体工具调用
2025-03-26 Gemini 2.5 Pro 86.7% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind 发布 Gemini 2.5 Pro 实验模型
2025-03-11 Grok 3 93.3% xAI发布具有深度推理和百万token上下文的Grok 3
2025-02-26 Grok 3 Beta 93.3% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 OpenAI o3-mini 83.3% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 DeepSeek R1 79.8% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 Claude 3.7 Sonnet 61.3% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 Claude 3.5 Sonnet 41.3% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-19 Grok 3 (Think) 93.3% xAI发布Grok 3 Beta版和DeepSearch智能体
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 利用大语言模型扩展强化学习,性能匹敌 o1 并超越短链式思考模型
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 利用大语言模型扩展强化学习,性能匹敌 o1 并超越短链式思考模型