Benchmark · math

AIME 2025

31 résultats 27 modèles

AIME 2025 évalue le raisonnement mathématique avancé d'un modèle à partir des 15 problèmes de l'American Invitational Mathematics Examination de 2025, un concours difficile de niveau lycée. Chaque réponse est un entier de 0 à 999, et le score du modèle est le pourcentage de problèmes résolus correctement (souvent rapporté sous forme de pass@1 ou avg@k).

En savoir plus
Exemple
Un item typique est un problème de concours exigeant — par exemple de théorie des nombres ou de combinatoire — dont la solution est un unique entier entre 0 et 999, comme déterminer le nombre de paires ordonnées vérifiant un ensemble donné de conditions algébriques.
Notation
Chacun des 15 problèmes est noté par correspondance exacte de sa réponse entière, et le score est la fraction (pourcentage) résolue correctement ; comme les réponses varient d'une exécution à l'autre, les résultats sont généralement moyennés sur de nombreux échantillons (avg@k) ou rapportés en pass@1.
Vérification
La vérification est automatique et objective : l'entier final du modèle est comparé au corrigé officiel, sans note partielle ni jugement humain, de sorte qu'une solution n'est acceptée qu'en cas de correspondance numérique exacte.
Pourquoi c'est important
Les problèmes de l'AIME exigent un raisonnement créatif en plusieurs étapes plutôt que de la mémorisation ; ce benchmark est donc une mesure très suivie des capacités mathématiques des LLM de pointe et un chiffre phare fréquent lors de la sortie de nouveaux modèles de raisonnement.
Exemple résolu
Tâche
Problème représentatif de style AIME (la réponse est un entier de 0 à 999) : trouvez la somme de tous les entiers positifs n pour lesquels √(n² + 85n + 2017) est un entier.
Solution
Complétez le carré : (2m)² − (2n+85)² = 843 = 3·281. Factorisez la différence de carrés : (2m−2n−85)(2m+2n+85) = 843, d'où n = 168 ou n = 27. Somme = 168 + 27 = 195.
Explication
Compléter le carré transforme la condition en une différence de carrés (2m)² − (2n+85)² = 843 = 3·281, dont les seules factorisations positives donnent n = 168 et n = 27, de somme 195. L'AIME est noté par correspondance exacte de l'unique réponse entière (0–999), sans point partiel.
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
Chronologie
Date Modèle Score Source
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash : le modèle agentique MoE de 35B égale les modèles plus grands grâce à l'optimisation post-entraînement
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash : le modèle agentique MoE de 35B égale les modèles plus grands grâce à l'optimisation post-entraînement
2026-07-06 Agents-A1 79.0pts Étendre l'horizon, pas les paramètres : atteindre des performances de modèles à mille milliards de paramètres avec un agent de 35M
2026-07-05 DASH 50.8% DASH réduit la sur-réflexion dans les modèles de langage de raisonnement par l'attribution de crédit au niveau des segments
2026-05-14 o1-pro 86.0% OpenAI lance la famille o1, établissant l'ère du raisonnement avec le calcul au moment de l'inférence
2026-01-27 Kimi K2.5 96.1% Moonshot lance Kimi K2.5 avec la technologie Agent Swarm
2025-09-30 GLM-4.6 93.9% Zhipu AI lance GLM-4.6 avec des capacités agentic et une fenêtre de contexte de 128k
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic lance Claude Sonnet 4.5 avec des capacités de codage et d'agent améliorées
2025-08-07 GPT-5 94.6% OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée
2025-08-07 GPT-5 94.6% OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2 : modèle MoE ouvert avec 1T de paramètres et optimiseur MuonClip
2025-07-28 Kimi K2 49.5% Moonshot lance Kimi K2, un modèle MoE agénique ouvert avec 32 milliards de paramètres activés
2025-07-25 Grok 4 88.0% Epoch AI évalue les capacités mathématiques de Grok 4
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 améliore le raisonnement et la précision AIME à 87,5 %
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 introduit un mode de réflexion unifié et la prise en charge de 119 langues
2025-04-17 o4-mini 92.7% OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher
2025-04-16 OpenAI o3 98.4% OpenAI publie les modèles de raisonnement o3 et o4-mini avec utilisation d'outils agents
2025-04-16 OpenAI o4-mini 99.5% OpenAI publie les modèles de raisonnement o3 et o4-mini avec utilisation d'outils agents
2025-03-26 Gemini 2.5 Pro 86.7% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind lance le modèle expérimental Gemini 2.5 Pro
2025-03-11 Grok 3 93.3% xAI lance Grok 3 avec raisonnement profond et contexte de million de tokens
2025-02-26 Grok 3 Beta 93.3% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 OpenAI o3-mini 83.3% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 DeepSeek R1 79.8% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 Claude 3.7 Sonnet 61.3% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 41.3% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-19 Grok 3 (Think) 93.3% xAI publie Grok 3 Beta et l'agent DeepSearch
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 met à l'échelle l'apprentissage par renforcement avec des LLMs pour égaler o1 et battre les modèles short-CoT
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 met à l'échelle l'apprentissage par renforcement avec des LLMs pour égaler o1 et battre les modèles short-CoT