Benchmark · general

MMLU-Pro

11 条结果 10 个模型

MMLU-Pro 是 MMLU 的更难、更侧重推理的后继基准,它通过每题提供 10 个选项的多项选择题,考查模型在众多学科领域的知识与解题能力。成绩以准确率百分比表示,即回答正确的题目所占的比例。

了解更多
示例
一个典型题目是来自数学、物理、法律或工程等领域的多项选择题,需要多步推理,模型必须从 10 个选项中选出唯一正确的答案(原始 MMLU 只有 4 个选项)。
评分方式
评价指标是准确率(accuracy):模型选对选项的题目所占的百分比,计算方式为正确答案数除以总题目数。
验证方式
每个回答都由系统自动评分,将模型所选选项与已知的正确标签做精确匹配(exact match),无需人工评判。
为何重要
由于顶尖模型几乎已在原始 MMLU 上达到饱和,MMLU-Pro 更难的题目和 10 个选项使其区分度更高、对真实推理更敏感,从而更清晰地反映进展。
示例解析
任务
MMLU-Pro(物理,10 个选项)。一个抛体以 20 m/s 的速度、与水平方向成 30° 角从地面发射(g = 10 m/s²,忽略空气阻力)。它的最大高度是多少?A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
解答
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
解析
在最高点竖直速度为零,因此 h_max = v_y²/(2g),其中 v_y = v·sin30°;高度只由竖直分量决定。MMLU-Pro 通过将所选字母与标准答案精确匹配来评分(在其 10 个选项上的 accuracy)。
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
时间线
日期 模型 得分 来源
2025-07-28 GLM-4.5 84.6% 智谱AI发布面向智能体的GLM-4.5和GLM-4.5-Air基础模型
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-04-15 Gemini 2.0 Flash 77.6% Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 在推理、编码和中文写作方面优于 DeepSeek-V3
2024-12-17 Falcon3-3B-Instruct 29.7% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-12-17 Falcon3-7B-Base 39.2% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-12-17 Falcon3-10B-Base 42.5% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-06-20 Claude 3.5 Sonnet 90.4% Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现
2024-06-03 GPT-4o 72.6% MMLU-Pro 引入了更稳健的基准测试,包含10个选项和侧重推理的问题
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro 引入了更稳健的基准测试,包含10个选项和侧重推理的问题
2024-06-03 GPT-4o 72.6% MMLU-Pro paper