ベンチマーク · multimodal
MMMU
MMMU(Massive Multi-discipline Multimodal Understanding)は、多くの学問分野にわたり画像とテキストを組み合わせた大学レベルの問題に、モデルが答えられるかを評価します。結果は正答率(パーセント)で示されます。
詳しく見る
- 例
- 問題では、化学の図やグラフ、医療画像などがテキストとともに提示され、モデルが推論して正しい答えを選びます。大学の試験に出るような設問です。
- 採点方法
- 各問題は正解か不正解で判定され、スコアは正しく答えられた問題の割合(正答率)です。
- 検証方法
- 解答は参照解答との完全一致(exact match)で自動的に検証され(大半は多肢選択、一部は短い自由記述)、人手による判定は不要です。
- 重要な理由
- 数十の科目にわたり画像とテキストを対象とした専門的で大学レベルの推論を測るため、テキストだけの能力ではなく真のマルチモーダル理解を厳しく検証します。
解説付きの例
課題
(画像:回路図——12 V の電池が単一ループを構成し、2 つの抵抗 R1 = 4 Ω と R2 = 8 Ω が直列に接続されている。) 抵抗 R2 を流れる電流はいくらか?選択肢:(A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A。
解答
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
解説
直列回路ではすべての素子に同じ電流が流れ、全抵抗は各部の和になるため、I = 12/12 = 1.0 A となる。MMMU は予測した選択肢の記号と唯一の正解との完全一致で採点する。
| 日付 | モデル | スコア | ソース |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAIが統一ルーティングと専門レベルの推論を備えたGPT-5を発表 |
| 2025-08-07 | GPT-5 | 84.2% | OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース |
| 2025-04-17 | o4-mini | 81.6% | OpenAIが高速で低コストなマルチモーダル推論モデルo4-miniをリリース |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | Google、Gemini 1.5 Proの2倍の速度と向上した品質を持つGemini 2.0 Flashをリリース |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |