Benchmark · math

AIME 2024

30 条结果 27 个模型

AIME 2024 用 2024 年 American Invitational Mathematics Examination 的 15 道题来衡量模型的高级数学推理能力,并报告正确解出的百分比。

了解更多
示例
一个典型题目是高难度的中学竞赛题,例如数论或组合数学问题,其答案为单个整数(AIME 的答案始终是整数,通常在 0 到 999 之间)。
评分方式
指标是准确率:在 15 道题中答对的比例,因此每答对一题占总分的 1/15。
验证方式
结果通过精确匹配来判定:模型给出的最终整数答案必须与官方答案完全一致,由程序自动核对,没有部分得分,也不需要人工评判。
为何重要
它是一组高难度且较新的竞赛题,需要多步推理,因此被广泛用于比较前沿模型,而题目的新近性降低了训练数据污染的风险。
示例解析
任务
有多少个正整数 n ≤ 600 能被 4 或 6 整除,但不能被 5 整除?(AIME 的答案是 0 到 999 之间的整数。)
解答
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
解析
由容斥原理,能被 4 或 6 整除的有 200 个,其中 40 个还能被 5 整除,剩下 160 个。AIME 只自动评判最终的整数答案(0–999),没有过程分。
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
时间线
日期 模型 得分 来源
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD 将弱到强的 RL 收益蒸馏至更强的模型
2026-03-25 o3 96.7% OpenAI 宣布从 ChatGPT 中退役 o3 并分享基准测试分数
2025-08-06 GLM-4.5 91.0% 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型
2025-08-06 GLM-4.5-Air 89.4% 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型
2025-06-12 Magistral Medium 50.0% Mistral 推出具有可扩展强化学习管道的 Magistral 推理模型
2025-06-10 Magistral Small 70.7% Mistral AI 发布 Magistral 推理模型,提供开源与企业版
2025-06-10 Magistral Medium 73.6% Mistral AI 发布 Magistral 推理模型,提供开源与企业版
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 引入统一思维模式并支持 119 种语言
2025-04-17 o4-mini 93.4% OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking 使用强化学习提升推理能力
2025-03-26 Gemini 2.5 Pro 92.0% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 在推理、编码和中文写作方面优于 DeepSeek-V3
2025-03-05 GPT-4.5 36.7% OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制
2025-02-19 Grok 3 mini 95.8% xAI发布Grok 3 Beta版和DeepSearch智能体
2025-02-05 LIMO 57.1% GAIR-NLP 发布 LIMO,仅用 817 个样本实现强大的数学推理
2025-01-31 s1-32B 57.0% Simple Scaling Lab发布s1-32B,通过预算强制实现测试时扩展
2025-01-31 s1-32B 57.0% s1-32B 在竞赛数学上超越 o1-preview,采用简单的测试时扩展方法
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek 通过强化学习发布 R1 推理模型
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek 通过强化学习发布 R1 推理模型
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek 通过强化学习发布 R1 推理模型
2025-01-22 DeepSeek-R1 79.8% DeepSeek 通过强化学习发布 R1 推理模型
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI 发布 o3 模型,在推理和编程方面表现卓越
2024-11-28 QwQ-32B-Preview 50.0% Qwen发布QwQ-32B-Preview,一款实验性推理模型
2024-10-01 OpenAI o1-preview 83.0% 比较 OpenAI o1 与其他顶级模型
2024-09-12 o1 13.9% OpenAI发布o1-preview,一款在数学和科学基准测试中超越人类专家的推理模型