Benchmark · math

AIME 2024

30 résultats 27 modèles

AIME 2024 mesure le raisonnement mathématique avancé d'un modèle à partir des 15 problèmes de l'American Invitational Mathematics Examination 2024 et indique le pourcentage de réponses correctes.

En savoir plus
Exemple
Un item typique est un problème difficile de compétition de niveau lycée — par exemple en théorie des nombres ou en combinatoire — dont la réponse est un seul nombre entier (à l'AIME, la réponse est toujours un entier, généralement de 0 à 999).
Notation
La métrique est l'exactitude : la proportion des 15 problèmes résolus correctement, chaque problème résolu valant donc 1/15 du score.
Vérification
Le résultat est accepté par correspondance exacte : le nombre entier final du modèle doit être égal à la réponse officielle, vérifié automatiquement, sans points partiels ni évaluation humaine.
Pourquoi c'est important
Comme il s'agit d'un ensemble compact de problèmes de compétition difficiles et récents exigeant un raisonnement en plusieurs étapes, il est très utilisé pour comparer les modèles de pointe, et sa nouveauté limite la contamination des données d'entraînement.
Exemple résolu
Tâche
Combien d'entiers positifs n ≤ 600 sont divisibles par 4 ou par 6 mais pas par 5 ? (Les réponses de l'AIME sont des entiers de 0 à 999.)
Solution
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
Explication
Par inclusion-exclusion, 200 entiers sont divisibles par 4 ou 6, dont 40 le sont aussi par 5, ce qui laisse 160. L'AIME ne corrige automatiquement que l'entier final (0–999), sans points partiels pour le raisonnement.
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
Chronologie
Date Modèle Score Source
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD distille les gains du renforcement par apprentissage (RL) faible-vers-fort pour des modèles plus puissants
2026-03-25 o3 96.7% OpenAI annonce le retrait de o3 de ChatGPT et partage les scores des benchmarks
2025-08-06 GLM-4.5 91.0% Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek
2025-08-06 GLM-4.5-Air 89.4% Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek
2025-06-12 Magistral Medium 50.0% Mistral présente des modèles de raisonnement Magistral avec un pipeline RL évolutif
2025-06-10 Magistral Small 70.7% Mistral AI publie le modèle de raisonnement Magistral avec des versions open source et entreprise
2025-06-10 Magistral Medium 73.6% Mistral AI publie le modèle de raisonnement Magistral avec des versions open source et entreprise
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 introduit un mode de réflexion unifié et la prise en charge de 119 langues
2025-04-17 o4-mini 93.4% OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking utilise l'apprentissage par renforcement pour améliorer le raisonnement
2025-03-26 Gemini 2.5 Pro 92.0% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 améliore le raisonnement, la programmation et l'écriture en chinois par rapport à DeepSeek-V3
2025-03-05 GPT-4.5 36.7% OpenAI publie GPT-4.5, son plus grand modèle, pour ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic publie Claude 3.7 Sonnet avec contrôle dynamique du raisonnement
2025-02-19 Grok 3 mini 95.8% xAI publie Grok 3 Beta et l'agent DeepSearch
2025-02-05 LIMO 57.1% GAIR-NLP lance LIMO, atteignant un raisonnement mathématique fort avec 817 échantillons
2025-01-31 s1-32B 57.0% Simple Scaling Lab publie s1-32B avec mise à l'échelle au moment du test via la contrainte de budget
2025-01-31 s1-32B 57.0% s1-32B dépasse o1-preview en mathématiques de compétition grâce à une mise à l'échelle au moment du test simple
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2025-01-22 DeepSeek-R1 79.8% DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI lance le modèle o3 avec des performances élevées en raisonnement et en codage
2024-11-28 QwQ-32B-Preview 50.0% Qwen lance QwQ-32B-Preview, un modèle de raisonnement expérimental
2024-10-01 OpenAI o1-preview 83.0% Comparaison d'OpenAI o1 avec d'autres modèles de premier plan
2024-09-12 o1 13.9% OpenAI publie o1-preview, un modèle de raisonnement qui dépasse les experts humains sur les benchmarks en mathématiques et sciences