Benchmark · math
AIME 2024
AIME 2024 用 2024 年 American Invitational Mathematics Examination 的 15 道题来衡量模型的高级数学推理能力,并报告正确解出的百分比。
了解更多
- 示例
- 一个典型题目是高难度的中学竞赛题,例如数论或组合数学问题,其答案为单个整数(AIME 的答案始终是整数,通常在 0 到 999 之间)。
- 评分方式
- 指标是准确率:在 15 道题中答对的比例,因此每答对一题占总分的 1/15。
- 验证方式
- 结果通过精确匹配来判定:模型给出的最终整数答案必须与官方答案完全一致,由程序自动核对,没有部分得分,也不需要人工评判。
- 为何重要
- 它是一组高难度且较新的竞赛题,需要多步推理,因此被广泛用于比较前沿模型,而题目的新近性降低了训练数据污染的风险。
示例解析
任务
有多少个正整数 n ≤ 600 能被 4 或 6 整除,但不能被 5 整除?(AIME 的答案是 0 到 999 之间的整数。)
解答
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
解析
由容斥原理,能被 4 或 6 整除的有 200 个,其中 40 个还能被 5 整除,剩下 160 个。AIME 只自动评判最终的整数答案(0–999),没有过程分。
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2026-07-07 | Qwen3-1.7B | 62.4% | Direct-OPD 将弱到强的 RL 收益蒸馏至更强的模型 |
| 2026-03-25 | o3 | 96.7% | OpenAI 宣布从 ChatGPT 中退役 o3 并分享基准测试分数 |
| 2025-08-06 | GLM-4.5 | 91.0% | 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型 |
| 2025-08-06 | GLM-4.5-Air | 89.4% | 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型 |
| 2025-06-12 | Magistral Medium | 50.0% | Mistral 推出具有可扩展强化学习管道的 Magistral 推理模型 |
| 2025-06-10 | Magistral Small | 70.7% | Mistral AI 发布 Magistral 推理模型,提供开源与企业版 |
| 2025-06-10 | Magistral Medium | 73.6% | Mistral AI 发布 Magistral 推理模型,提供开源与企业版 |
| 2025-05-30 | Deepseek-R1-0528-Qwen3-8B | 86.0% | DeepSeek更新R1模型,提升推理能力与基准测试成绩 |
| 2025-05-30 | Deepseek-R1-0528 | 91.4% | DeepSeek更新R1模型,提升推理能力与基准测试成绩 |
| 2025-05-14 | Qwen3-235B-A22B | 85.7% | Qwen3 引入统一思维模式并支持 119 种语言 |
| 2025-04-17 | o4-mini | 93.4% | OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型 |
| 2025-04-16 | OpenAI o3 | 91.6% | OpenAI |
| 2025-04-10 | Seed1.5-Thinking | 86.7% | Seed1.5-Thinking 使用强化学习提升推理能力 |
| 2025-03-26 | Gemini 2.5 Pro | 92.0% | Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文 |
| 2025-03-24 | DeepSeek-V3-0324 | 59.4% | DeepSeek-V3-0324 在推理、编码和中文写作方面优于 DeepSeek-V3 |
| 2025-03-05 | GPT-4.5 | 36.7% | OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型 |
| 2025-02-24 | Claude 3.7 Sonnet | 80.0% | Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制 |
| 2025-02-19 | Grok 3 mini | 95.8% | xAI发布Grok 3 Beta版和DeepSearch智能体 |
| 2025-02-05 | LIMO | 57.1% | GAIR-NLP 发布 LIMO,仅用 817 个样本实现强大的数学推理 |
| 2025-01-31 | s1-32B | 57.0% | Simple Scaling Lab发布s1-32B,通过预算强制实现测试时扩展 |
| 2025-01-31 | s1-32B | 57.0% | s1-32B 在竞赛数学上超越 o1-preview,采用简单的测试时扩展方法 |
| 2025-01-22 | DeepSeek-R1-Distill-Qwen-7B | 55.5% | DeepSeek 通过强化学习发布 R1 推理模型 |
| 2025-01-22 | DeepSeek-R1-Zero | 71.0% | DeepSeek 通过强化学习发布 R1 推理模型 |
| 2025-01-22 | DeepSeek-R1-Distill-Qwen-32B | 72.6% | DeepSeek 通过强化学习发布 R1 推理模型 |
| 2025-01-22 | DeepSeek-R1 | 79.8% | DeepSeek 通过强化学习发布 R1 推理模型 |
| 2025-01-20 | DeepSeek R1 | 79.8% | DeepSeek |
| 2024-12-20 | o3 | 96.7% | OpenAI 发布 o3 模型,在推理和编程方面表现卓越 |
| 2024-11-28 | QwQ-32B-Preview | 50.0% | Qwen发布QwQ-32B-Preview,一款实验性推理模型 |
| 2024-10-01 | OpenAI o1-preview | 83.0% | 比较 OpenAI o1 与其他顶级模型 |
| 2024-09-12 | o1 | 13.9% | OpenAI发布o1-preview,一款在数学和科学基准测试中超越人类专家的推理模型 |