Benchmark · multimodal
MMMU
MMMU (Massive Multi-discipline Multimodal Understanding) évalue si un modèle peut répondre à des questions de niveau universitaire qui combinent images et texte dans de nombreuses disciplines. Le résultat est exprimé en pourcentage de bonnes réponses (exactitude).
En savoir plus
- Exemple
- Une question peut présenter un schéma de chimie, un graphique ou une image médicale accompagnés de texte et demander au modèle de raisonner pour choisir la bonne réponse, comme dans un examen universitaire.
- Notation
- Chaque question est notée juste ou fausse, et le score correspond au pourcentage de questions correctement répondues (exactitude).
- Vérification
- Les réponses sont vérifiées automatiquement par correspondance exacte avec la réponse de référence (surtout des QCM, parfois de courtes réponses libres), sans jugement humain.
- Pourquoi c'est important
- Il mesure un raisonnement expert de niveau universitaire sur des images et du texte dans des dizaines de matières, ce qui en fait un test exigeant de véritable compréhension multimodale, et non de simples compétences textuelles.
Exemple résolu
Tâche
(Image : un schéma de circuit — une pile de 12 V dans une seule boucle avec deux résistances en série, R1 = 4 Ω et R2 = 8 Ω.) Quel est le courant qui traverse la résistance R2 ? Options : (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solution
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Explication
Dans un circuit en série, le même courant traverse tous les éléments et la résistance totale est la somme des parties, donc I = 12/12 = 1.0 A. MMMU l'évalue par correspondance exacte entre la lettre de l'option prédite et l'unique bonne réponse.
| Date | Modèle | Score | Source |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert |
| 2025-08-07 | GPT-5 | 84.2% | OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée |
| 2025-04-17 | o4-mini | 81.6% | OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |