Benchmark · math

MATH-500

saturated 18 résultats 17 modèles

MATH-500 est un sous-ensemble de 500 problèmes du jeu de données de mathématiques de compétition MATH, qui évalue la capacité d'un modèle à résoudre des problèmes mathématiques difficiles. Le score est le pourcentage de problèmes dont le modèle trouve la bonne réponse finale.

En savoir plus
Exemple
Un élément typique est un problème mathématique de type compétition — par exemple une question d'algèbre, de géométrie ou de théorie des nombres qui demande une seule réponse finale (un nombre ou une expression en forme close) après plusieurs étapes de raisonnement.
Notation
Le score est la proportion des 500 problèmes que le modèle résout correctement, c'est-à-dire accuracy = réponses finales correctes / 500, exprimée en pourcentage.
Vérification
Un problème est considéré comme résolu lorsque la réponse finale du modèle correspond exactement à la réponse de référence (une vérification automatique d'équivalence de la réponse finale, et non des étapes intermédiaires).
Pourquoi c'est important
C'est une mesure compacte et très utilisée du raisonnement mathématique qui s'exécute plus vite que le jeu MATH complet, ce qui en fait une vérification rapide courante pour comparer les modèles de raisonnement.
Exemple résolu
Tâche
Pour certaines valeurs de $k$, l'équation du second degré $x^2 - kx + 16 = 0$ n'a que des racines entières positives. Trouvez la somme de toutes les valeurs distinctes possibles de $k$.
Solution
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
Explication
Les racines $r,s$ sont des entiers positifs avec $rs=16$ et $k=r+s$ ; les paires de facteurs $(1,16),(2,8),(4,4)$ donnent $k=17,10,8$, donc la somme des valeurs distinctes est $35$. MATH-500 note par correspondance exacte de la réponse finale normalisée dans \boxed{}, donc seul $35$ compte.
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
Chronologie
Date Modèle Score Source
2026-07-07 Qwen3.6-27B 87.0% DFlash intégré dans llama.cpp offre un gain de vitesse de 4,44x sur Qwen3.6-27B
2026-07-07 Qwen3.6-27B-DFlash 86.0% DFlash intégré dans llama.cpp offre un gain de vitesse de 4,44x sur Qwen3.6-27B
2025-08-06 GLM-4.5 98.2% Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek
2025-04-30 Phi-4-Mini-Reasoning 3.2% Microsoft lance Phi-4-Mini-Reasoning, un modèle de 3,8 milliards de paramètres surpassant les modèles de raisonnement plus grands
2025-04-30 Llama-8B 89.1% Microsoft lance Phi-4-Mini-Reasoning, un modèle de 3,8 milliards de paramètres surpassant les modèles de raisonnement plus grands
2025-04-30 Qwen-1.5B 83.9% Microsoft lance Phi-4-Mini-Reasoning, un modèle de 3,8 milliards de paramètres surpassant les modèles de raisonnement plus grands
2025-04-15 Gemini 2.0 Flash 90.9% Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro
2025-02-26 Claude 3.7 Sonnet 96.2% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 82.2% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-05 LIMO 94.8% GAIR-NLP lance LIMO, atteignant un raisonnement mathématique fort avec 817 échantillons
2025-01-22 Kimi k1.5 96.2% Kimi k1.5 met à l'échelle l'apprentissage par renforcement avec des LLMs pour égaler o1 et battre les modèles short-CoT
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5 met à l'échelle l'apprentissage par renforcement avec des LLMs pour égaler o1 et battre les modèles short-CoT
2025-01-22 DeepSeek-R1 97.3% DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2024-11-28 QwQ-32B-Preview 90.6% Qwen lance QwQ-32B-Preview, un modèle de raisonnement expérimental
2024-06-20 Claude 3.5 Sonnet 71.1% Anthropic publie un complément à Claude 3.5 Sonnet avec des benchmarks de codage et de vision améliorés
2024-03-28 Grok-1.5 50.6% xAI lance Grok-1.5 avec un raisonnement amélioré et un contexte de 128K
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B atteint 51,7 % sur le benchmark MATH en utilisant GRPO et des données curatées