ベンチマーク · multimodal
MMMU-Pro
MMMU-Pro は MMMU ベンチマークの頑健性を強化した版で、6 つの学問分野にわたる大学レベルのマルチモーダル(画像 + テキスト)理解・推論能力を測定します。指標は多肢選択問題の正解率(accuracy)です。
詳しく見る
- 例
- ある分野の問題は、画像——図表、グラフ、化学構造式、医用画像など——を大学レベルの設問および最大 10 個の選択肢と組み合わせます。視覚のみ(vision-only)設定では、設問と選択肢の全体がスクリーンショットや写真の中に埋め込まれるため、モデルは画像そのものからテキストを読み取らなければなりません。
- 採点方法
- 正解率(accuracy):モデルが選んだ選択肢を正解キーと完全一致で照合し、スコアは正しく答えた問題の割合です。当て推量を抑えるため候補選択肢は 4 個から 10 個に拡張され、MMMU-Pro の総合スコアは Standard(10 選択肢)設定と Vision(画像入力)設定の平均です(通常は Chain-of-Thought の推論プロンプトが用いられます)。
- 検証方法
- 各問題は正解が 1 つの多肢選択なので採点は自動です。モデルの出力(多くは思考連鎖を含む)から最終的に選ばれた選択肢を抽出し、参照解答と完全一致で照合します。頑健性はデータ自体に組み込まれており——テキストのみのモデルが答えられる問題は除外され、選択肢数は 10 に引き上げられます——そのため高得点は、テキストの近道やまぐれ当たりではなく、真のマルチモーダル推論を反映します。
- 重要な理由
- 元の MMMU は、モデルがテキストのみの近道を突いたり 4 択で当て推量できたりしたためスコアが過大評価されていました。MMMU-Pro はその両方を取り除くので、測定される正解率は大きく下がり、視覚とテキストを本当に統合するモデルをより明確に区別します——専門家レベルのマルチモーダル能力をより誠実に測る指標となります。
解説付きの例
課題
MMMU-Pro 形式による科学(物理)の代表的な問題。[画像:傾斜角 θ = 30° の摩擦のない斜面上に置かれた物体。] 設問:斜面に沿った物体の加速度の大きさはいくらか。選択肢(10):(A) 0 m/s² (B) 1.6 m/s² (C) 2.5 m/s² (D) 3.3 m/s² (E) 4.9 m/s² (F) 5.7 m/s² (G) 6.9 m/s² (H) 7.4 m/s² (I) 8.5 m/s² (J) 9.8 m/s²。視覚のみ設定では、この設問全体がスクリーンショット内に埋め込まれて表示されます。
解答
a = g·sin θ = 9.8 × sin 30° = 9.8 × 0.5 = 4.9 m/s² → (E)
解説
摩擦のない斜面では、面に沿って働く力は重力の成分 mg·sin θ のみなので、加速度は g·sin θ となり物体の質量に依存しません。g·sin 30° = 4.9 m/s² であり、選択肢 (E) に一致します。採点は、抽出した選択肢の記号を正解キーと完全一致で照合します。
| 日付 | モデル | スコア | ソース |
|---|---|---|---|
| 2026-08-03 | Inkling-Small | 74.0% | Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース |
| 2026-07-17 | Kimi K3 | 81.6% | Moonshot AIが2.8TパラメータのMoEモデル「Kimi K3」を1Mコンテキストで公開 |
| 2026-03-06 | Claude Opus 4.6 | 70.6% | AnthropicがClaude Opus 4.6のシステムカードを公開し、機能と安全性評価の詳細を明かす |
| 2026-02-05 | Claude Opus 4.6 | 73.9% | Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース |
| 2026-02-05 | Claude Opus 4.6 | 70.6% | AnthropicがClaude Opus 4.6のシステムカードを公開し、能力と安全性評価の詳細を明記 |
| 2025-11-18 | Gemini 3 Pro | 81.0% | GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載 |
| 2025-11-18 | Gemini 3 Pro | 81.0% | Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース |
| 2025-05-20 | Gemini 2.5 Pro Deep Think | 84.0% | Google DeepMind、Deep Think、音声出力、コンピュータ操作機能を搭載したGemini 2.5を更新 |
| 2024-09-12 | o1 | 78.2% | OpenAIが数学・科学ベンチマークで人間の専門家を上回る推論モデルo1-previewをリリース |
| 2024-06-20 | Claude 3.5 Sonnet | 68.3% | AnthropicがClaude 3.5 Sonnetの補遺をリリースし、コーディングとビジョンベンチマークが改善 |
| 2023-12-06 | Gemini Ultra | 59.4% | Google、最大規模のマルチモーダルAIモデル「Gemini 1.0」を発表 |