Benchmark · multimodal

MMMU

8 条结果 7 个模型

MMMU(Massive Multi-discipline Multimodal Understanding)考查模型能否回答涵盖众多学科、同时结合图像与文本的大学水平题目。结果以正确率(百分比)表示。

了解更多
示例
一道题目可能给出化学示意图、图表或医学影像并配上文字,要求模型进行推理并选出正确答案,就像大学考试中的题目。
评分方式
每道题判定为对或错,最终得分是答对题目所占的百分比(正确率)。
验证方式
答案通过与参考答案精确匹配(exact match)自动核对(大多为多项选择,少量为简短开放式回答),无需人工评判。
为何重要
它衡量的是跨数十个学科、结合图像与文本的大学水平专家级推理,因此是对真正多模态理解能力的严格检验,而不仅仅是纯文本能力。
示例解析
任务
(图片:一张电路图——一个 12 V 电池组成单回路,串联两个电阻 R1 = 4 Ω 和 R2 = 8 Ω。) 通过电阻 R2 的电流是多少?选项:(A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A。
解答
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
解析
在串联电路中,流过每个元件的电流相同,总电阻等于各部分之和,因此 I = 12/12 = 1.0 A。MMMU 通过将预测的选项字母与唯一的标准答案精确匹配来评分。
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
时间线
日期 模型 得分 来源
2025-08-07 GPT-5 84.2% OpenAI 推出 GPT-5,具备统一路由与专家级推理能力
2025-08-07 GPT-5 84.2% OpenAI 发布具备自适应推理与统一架构的 GPT-5
2025-04-17 o4-mini 81.6% OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2025-04-15 Gemini 2.0 Flash 71.7% Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍
2025-03-26 Gemini 2.5 Pro 81.7% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper