Benchmark · multimodal
MMMU
MMMU(Massive Multi-discipline Multimodal Understanding)考查模型能否回答涵盖众多学科、同时结合图像与文本的大学水平题目。结果以正确率(百分比)表示。
了解更多
- 示例
- 一道题目可能给出化学示意图、图表或医学影像并配上文字,要求模型进行推理并选出正确答案,就像大学考试中的题目。
- 评分方式
- 每道题判定为对或错,最终得分是答对题目所占的百分比(正确率)。
- 验证方式
- 答案通过与参考答案精确匹配(exact match)自动核对(大多为多项选择,少量为简短开放式回答),无需人工评判。
- 为何重要
- 它衡量的是跨数十个学科、结合图像与文本的大学水平专家级推理,因此是对真正多模态理解能力的严格检验,而不仅仅是纯文本能力。
示例解析
任务
(图片:一张电路图——一个 12 V 电池组成单回路,串联两个电阻 R1 = 4 Ω 和 R2 = 8 Ω。) 通过电阻 R2 的电流是多少?选项:(A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A。
解答
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
解析
在串联电路中,流过每个元件的电流相同,总电阻等于各部分之和,因此 I = 12/12 = 1.0 A。MMMU 通过将预测的选项字母与唯一的标准答案精确匹配来评分。
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI 推出 GPT-5,具备统一路由与专家级推理能力 |
| 2025-08-07 | GPT-5 | 84.2% | OpenAI 发布具备自适应推理与统一架构的 GPT-5 |
| 2025-04-17 | o4-mini | 81.6% | OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型 |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍 |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文 |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |