Benchmark · multimodal

MMMU

8 résultats 7 modèles

MMMU (Massive Multi-discipline Multimodal Understanding) évalue si un modèle peut répondre à des questions de niveau universitaire qui combinent images et texte dans de nombreuses disciplines. Le résultat est exprimé en pourcentage de bonnes réponses (exactitude).

En savoir plus
Exemple
Une question peut présenter un schéma de chimie, un graphique ou une image médicale accompagnés de texte et demander au modèle de raisonner pour choisir la bonne réponse, comme dans un examen universitaire.
Notation
Chaque question est notée juste ou fausse, et le score correspond au pourcentage de questions correctement répondues (exactitude).
Vérification
Les réponses sont vérifiées automatiquement par correspondance exacte avec la réponse de référence (surtout des QCM, parfois de courtes réponses libres), sans jugement humain.
Pourquoi c'est important
Il mesure un raisonnement expert de niveau universitaire sur des images et du texte dans des dizaines de matières, ce qui en fait un test exigeant de véritable compréhension multimodale, et non de simples compétences textuelles.
Exemple résolu
Tâche
(Image : un schéma de circuit — une pile de 12 V dans une seule boucle avec deux résistances en série, R1 = 4 Ω et R2 = 8 Ω.) Quel est le courant qui traverse la résistance R2 ? Options : (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solution
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Explication
Dans un circuit en série, le même courant traverse tous les éléments et la résistance totale est la somme des parties, donc I = 12/12 = 1.0 A. MMMU l'évalue par correspondance exacte entre la lettre de l'option prédite et l'unique bonne réponse.
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
Chronologie
Date Modèle Score Source
2025-08-07 GPT-5 84.2% OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert
2025-08-07 GPT-5 84.2% OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée
2025-04-17 o4-mini 81.6% OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher
2025-04-15 Gemini 2.0 Flash 71.7% Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 81.7% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper