Benchmark · general
MMLU-Pro
MMLU-Pro 是 MMLU 的更难、更侧重推理的后继基准,它通过每题提供 10 个选项的多项选择题,考查模型在众多学科领域的知识与解题能力。成绩以准确率百分比表示,即回答正确的题目所占的比例。
了解更多
- 示例
- 一个典型题目是来自数学、物理、法律或工程等领域的多项选择题,需要多步推理,模型必须从 10 个选项中选出唯一正确的答案(原始 MMLU 只有 4 个选项)。
- 评分方式
- 评价指标是准确率(accuracy):模型选对选项的题目所占的百分比,计算方式为正确答案数除以总题目数。
- 验证方式
- 每个回答都由系统自动评分,将模型所选选项与已知的正确标签做精确匹配(exact match),无需人工评判。
- 为何重要
- 由于顶尖模型几乎已在原始 MMLU 上达到饱和,MMLU-Pro 更难的题目和 10 个选项使其区分度更高、对真实推理更敏感,从而更清晰地反映进展。
示例解析
任务
MMLU-Pro(物理,10 个选项)。一个抛体以 20 m/s 的速度、与水平方向成 30° 角从地面发射(g = 10 m/s²,忽略空气阻力)。它的最大高度是多少?A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
解答
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
解析
在最高点竖直速度为零,因此 h_max = v_y²/(2g),其中 v_y = v·sin30°;高度只由竖直分量决定。MMLU-Pro 通过将所选字母与标准答案精确匹配来评分(在其 10 个选项上的 accuracy)。
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2025-07-28 | GLM-4.5 | 84.6% | 智谱AI发布面向智能体的GLM-4.5和GLM-4.5-Air基础模型 |
| 2025-05-30 | Deepseek-R1-0528 | 85.0% | DeepSeek更新R1模型,提升推理能力与基准测试成绩 |
| 2025-04-15 | Gemini 2.0 Flash | 77.6% | Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍 |
| 2025-03-24 | DeepSeek-V3-0324 | 81.2% | DeepSeek-V3-0324 在推理、编码和中文写作方面优于 DeepSeek-V3 |
| 2024-12-17 | Falcon3-3B-Instruct | 29.7% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-12-17 | Falcon3-7B-Base | 39.2% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-12-17 | Falcon3-10B-Base | 42.5% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-06-20 | Claude 3.5 Sonnet | 90.4% | Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现 |
| 2024-06-03 | GPT-4o | 72.6% | MMLU-Pro 引入了更稳健的基准测试,包含10个选项和侧重推理的问题 |
| 2024-06-03 | GPT-4-Turbo | 63.7% | MMLU-Pro 引入了更稳健的基准测试,包含10个选项和侧重推理的问题 |
| 2024-06-03 | GPT-4o | 72.6% | MMLU-Pro paper |