Benchmark · general

MMLU

saturated 15 résultats 12 modèles

MMLU (Massive Multitask Language Understanding) évalue l'étendue des connaissances d'un modèle dans 57 matières — de l'histoire et du droit aux mathématiques et à la médecine — au moyen de questions à choix multiple. Le résultat s'exprime en % de précision (accuracy) : la part de questions auxquelles le modèle répond correctement.

En savoir plus
Exemple
Un item typique présente une question et quatre réponses étiquetées (A–D), et le modèle doit choisir la bonne — par exemple une question de médecine de niveau universitaire ou un problème de mathématiques élémentaires.
Notation
La métrique est la précision (accuracy) : le pourcentage de questions à choix multiple pour lesquelles le modèle choisit la bonne option, moyenné sur l'ensemble des 57 matières.
Vérification
La notation est automatique et objective — la lettre choisie par le modèle est comparée par correspondance exacte (exact-match) à la bonne réponse connue, sans intervention humaine.
Pourquoi c'est important
MMLU est devenu un étalon standard de l'étendue des connaissances et du raisonnement, mais les meilleurs modèles y obtiennent des scores si élevés qu'il est largement saturé et distingue moins bien les systèmes de pointe.
Exemple résolu
Tâche
Voici une question à choix multiple portant sur la chimie du lycée. Lequel des composés suivants est un acide fort ? A) HF B) HCl C) CH3COOH D) H2CO3
Solution
HCl s'ionise totalement dans l'eau, c'est donc un acide fort ; HF, CH3COOH et H2CO3 ne s'ionisent que partiellement (acides faibles). Réponse finale : B) HCl.
Explication
Un acide fort se dissocie entièrement en H+ et sa base conjuguée en solution aqueuse, ce que fait HCl mais pas les autres. MMLU l'évalue par exactitude de correspondance exacte : la lettre de l'option choisie doit être égale à l'étiquette correcte (B).
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
Chronologie
Date Modèle Score Source
2025-04-15 Gemini 2.0 Flash 83.4% Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 80.1% OpenAI lance GPT-4.1, GPT-4.1 mini et GPT-4.1 nano dans l'API
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropic publie Claude 3.7 Sonnet avec contrôle dynamique du raisonnement
2024-12-17 Falcon3-10B-Base 73.1% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-12-17 Falcon3-7B-Base 67.4% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-07-25 Mistral Large 2 84.0% Mistral publie Mistral Large 2 avec un contexte de 128K et un support multilingue amélioré
2024-07-24 Mistral Large 2 84.0% Mistral publie Large 2 avec 123B de paramètres pour une inférence mono-nœud rentable
2024-07-15 Qwen2-72B 84.2% L'équipe Qwen publie la série Qwen2 avec des modèles denses et MoE de 72B
2024-07-15 Qwen2-72B 84.2% Le rapport technique Qwen2 présente des modèles denses et MoE jusqu'à 72 milliards de paramètres
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google présente Gemini 1.0, son plus grand modèle d'IA multimodal
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI