Benchmark · math

MATH-500

saturated 18 条结果 17 个模型

MATH-500 是竞赛数学数据集 MATH 的一个包含 500 道题目的子集,用于测试模型解决高难度数学题的能力。分数是模型给出正确最终答案的题目所占的百分比。

了解更多
示例
一个典型题目是竞赛风格的数学题——例如一道代数、几何或数论题,需要经过若干步推理后给出唯一的最终答案(一个数字或闭式表达式)。
评分方式
分数是模型答对的题目在 500 道中所占的比例,即 accuracy = 正确的最终答案数 / 500,以百分比表示。
验证方式
当模型的最终答案与参考答案完全一致时,该题目才算解出(对最终答案进行自动等价性检查,而不是检查中间步骤)。
为何重要
它是一个紧凑且被广泛使用的数学推理衡量标准,运行速度比完整的 MATH 数据集更快,因此常被用作比较推理模型时的快速检验。
示例解析
任务
对于某些 $k$ 值,二次方程 $x^2 - kx + 16 = 0$ 只有正整数根。求所有不同的可能 $k$ 值之和。
解答
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
解析
根 $r,s$ 为正整数,满足 $rs=16$ 且 $k=r+s$;因数对 $(1,16),(2,8),(4,4)$ 给出 $k=17,10,8$,因此不同值之和为 $35$。MATH-500 按归一化后 \boxed{} 最终答案的精确匹配评分,所以只有 $35$ 计入。
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
时间线
日期 模型 得分 来源
2026-07-07 Qwen3.6-27B 87.0% DFlash合并入llama.cpp使Qwen 3.6 27B速度提升4.44倍
2026-07-07 Qwen3.6-27B-DFlash 86.0% DFlash合并入llama.cpp使Qwen 3.6 27B速度提升4.44倍
2025-08-06 GLM-4.5 98.2% 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型
2025-04-30 Phi-4-Mini-Reasoning 3.2% 微软发布 Phi-4-Mini-Reasoning,3.8B 模型性能超越更大规模的推理模型
2025-04-30 Llama-8B 89.1% 微软发布 Phi-4-Mini-Reasoning,3.8B 模型性能超越更大规模的推理模型
2025-04-30 Qwen-1.5B 83.9% 微软发布 Phi-4-Mini-Reasoning,3.8B 模型性能超越更大规模的推理模型
2025-04-15 Gemini 2.0 Flash 90.9% Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍
2025-02-26 Claude 3.7 Sonnet 96.2% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 Claude 3.5 Sonnet 82.2% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-05 LIMO 94.8% GAIR-NLP 发布 LIMO,仅用 817 个样本实现强大的数学推理
2025-01-22 Kimi k1.5 96.2% Kimi k1.5 利用大语言模型扩展强化学习,性能匹敌 o1 并超越短链式思考模型
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5 利用大语言模型扩展强化学习,性能匹敌 o1 并超越短链式思考模型
2025-01-22 DeepSeek-R1 97.3% DeepSeek 通过强化学习发布 R1 推理模型
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek 通过强化学习发布 R1 推理模型
2024-11-28 QwQ-32B-Preview 90.6% Qwen发布QwQ-32B-Preview,一款实验性推理模型
2024-06-20 Claude 3.5 Sonnet 71.1% Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现
2024-03-28 Grok-1.5 50.6% xAI发布Grok-1.5,推理能力增强,支持128K上下文
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B 使用 GRPO 和精选数据在 MATH 基准测试中取得 51.7% 的成绩