Benchmark · general

MMLU-Pro

11 résultats 10 modèles

MMLU-Pro est un successeur plus difficile et axé sur le raisonnement de MMLU qui évalue les connaissances et la résolution de problèmes d'un modèle dans de nombreuses disciplines académiques, à l'aide de questions à choix multiple comportant chacune 10 options de réponse. Le résultat est exprimé en pourcentage d'exactitude — la proportion de questions auxquelles le modèle répond correctement.

En savoir plus
Exemple
Un item typique est une question à choix multiple d'un domaine comme les mathématiques, la physique, le droit ou l'ingénierie, nécessitant plusieurs étapes de raisonnement, où le modèle doit choisir l'unique bonne réponse parmi 10 options (contre 4 dans le MMLU d'origine).
Notation
La métrique est l'exactitude (accuracy) : le pourcentage de questions pour lesquelles le modèle choisit la bonne option, calculé comme le nombre de bonnes réponses divisé par le nombre total de questions.
Vérification
Chaque réponse est notée automatiquement en comparant par correspondance exacte l'option choisie par le modèle à l'étiquette correcte connue, sans intervention humaine.
Pourquoi c'est important
Comme les meilleurs modèles avaient presque saturé le MMLU d'origine, les questions plus ardues et les 10 options de MMLU-Pro le rendent plus discriminant et plus sensible au raisonnement réel, offrant une mesure plus nette des progrès.
Exemple résolu
Tâche
MMLU-Pro (physique, 10 options). Un projectile est lancé depuis le sol à 20 m/s, à 30° au-dessus de l'horizontale (g = 10 m/s², sans résistance de l'air). Quelle est sa hauteur maximale ? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
Solution
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
Explication
Au sommet la vitesse verticale est nulle, donc h_max = v_y²/(2g) avec v_y = v·sin30° ; seule la composante verticale fixe la hauteur. MMLU-Pro note par correspondance exacte de la lettre choisie avec la clé de référence (accuracy sur ses 10 options).
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
Chronologie
Date Modèle Score Source
2025-07-28 GLM-4.5 84.6% Zhipu AI publie les modèles de base GLM-4.5 et GLM-4.5-Air pour les agents intelligents
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-04-15 Gemini 2.0 Flash 77.6% Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 améliore le raisonnement, la programmation et l'écriture en chinois par rapport à DeepSeek-V3
2024-12-17 Falcon3-3B-Instruct 29.7% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-12-17 Falcon3-7B-Base 39.2% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-12-17 Falcon3-10B-Base 42.5% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-06-20 Claude 3.5 Sonnet 90.4% Anthropic publie un complément à Claude 3.5 Sonnet avec des benchmarks de codage et de vision améliorés
2024-06-03 GPT-4o 72.6% MMLU-Pro introduit un benchmark plus robuste avec 10 options et des questions axées sur le raisonnement
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro introduit un benchmark plus robuste avec 10 options et des questions axées sur le raisonnement
2024-06-03 GPT-4o 72.6% MMLU-Pro paper