Benchmark · math

GSM8K

saturated 11 条结果 10 个模型

GSM8K(Grade School Math 8K)是一个小学数学应用题基准,每道题都需要多步算术推理才能解出;模型的得分是最终数字答案正确的题目所占的百分比。

了解更多
示例
一道简短的应用题,例如「Natalia 四月向 48 位朋友卖出发夹,五月卖出的数量是四月的一半;她一共卖了多少个发夹?」——模型必须一步步推算并给出最终数字。
评分方式
分数就是 accuracy(准确率):最终数字答案与参考答案完全一致的题目所占比例;中间推理过程不计分,只看最终数字。
验证方式
验证是自动且精确匹配的:从模型输出中解析出最终数字(通常在「####」这样的分隔符之后),与标准答案比较,无需人工判断。
为何重要
它成为衡量多步推理能力的标准且易于检验的测试,而广为人知的 chain-of-thought(思维链)提示技巧被证明能显著提升其成绩,使它成为常用的推理能力标尺。
示例解析
任务
玛丽亚有 3 盒蜡笔,每盒 24 支。她给了弟弟 15 支,然后又买了 2 整盒。她现在有多少支蜡笔?
解答
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
解析
先相乘得到初始数量,减去送出的,再加上新买的盒数:72 − 15 + 48 = 105。GSM8K 仅按精确匹配对 '####' 分隔符之后提取的最终数字评分,因此推理步骤不计分——只有 105 才算数。
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
时间线
日期 模型 得分 来源
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor 推出志愿者训练 Beta 版及 Qwen2.5-7B GSM8K 活动 RFC 草案
2026-07-13 Gemma-4-12B 86.0% Flint压缩推理轨迹以减少令牌使用量同时保持准确性
2024-12-17 Falcon3-10B-Base 83.0% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-12-17 Falcon3-7B-Base 79.1% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-12-17 Falcon3-10B-Instruct 83.1% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-07-15 Qwen2-72B 89.5% Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型
2024-07-15 Qwen2-72B 89.5% Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型
2024-06-20 Claude 3.5 Sonnet 91.6% Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现
2024-04-23 DUP method 97.1% 深入理解问题方法在GSM8K上达到97.1%
2024-03-28 Grok-1.5 90.0% xAI发布Grok-1.5,推理能力增强,支持128K上下文
2023-03-14 GPT-4 92.0% OpenAI