Benchmark · math
GSM8K
GSM8K(Grade School Math 8K)是一个小学数学应用题基准,每道题都需要多步算术推理才能解出;模型的得分是最终数字答案正确的题目所占的百分比。
了解更多
- 示例
- 一道简短的应用题,例如「Natalia 四月向 48 位朋友卖出发夹,五月卖出的数量是四月的一半;她一共卖了多少个发夹?」——模型必须一步步推算并给出最终数字。
- 评分方式
- 分数就是 accuracy(准确率):最终数字答案与参考答案完全一致的题目所占比例;中间推理过程不计分,只看最终数字。
- 验证方式
- 验证是自动且精确匹配的:从模型输出中解析出最终数字(通常在「####」这样的分隔符之后),与标准答案比较,无需人工判断。
- 为何重要
- 它成为衡量多步推理能力的标准且易于检验的测试,而广为人知的 chain-of-thought(思维链)提示技巧被证明能显著提升其成绩,使它成为常用的推理能力标尺。
示例解析
任务
玛丽亚有 3 盒蜡笔,每盒 24 支。她给了弟弟 15 支,然后又买了 2 整盒。她现在有多少支蜡笔?
解答
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
解析
先相乘得到初始数量,减去送出的,再加上新买的盒数:72 − 15 + 48 = 105。GSM8K 仅按精确匹配对 '####' 分隔符之后提取的最终数字评分,因此推理步骤不计分——只有 105 才算数。
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2026-07-26 | Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 | 74.219% | CrowdTensor 推出志愿者训练 Beta 版及 Qwen2.5-7B GSM8K 活动 RFC 草案 |
| 2026-07-13 | Gemma-4-12B | 86.0% | Flint压缩推理轨迹以减少令牌使用量同时保持准确性 |
| 2024-12-17 | Falcon3-10B-Base | 83.0% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-12-17 | Falcon3-7B-Base | 79.1% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-12-17 | Falcon3-10B-Instruct | 83.1% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-07-15 | Qwen2-72B | 89.5% | Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型 |
| 2024-07-15 | Qwen2-72B | 89.5% | Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型 |
| 2024-06-20 | Claude 3.5 Sonnet | 91.6% | Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现 |
| 2024-04-23 | DUP method | 97.1% | 深入理解问题方法在GSM8K上达到97.1% |
| 2024-03-28 | Grok-1.5 | 90.0% | xAI发布Grok-1.5,推理能力增强,支持128K上下文 |
| 2023-03-14 | GPT-4 | 92.0% | OpenAI |