Benchmark · math

GSM8K

saturated 11 résultats 10 modèles

GSM8K (Grade School Math 8K) est un benchmark de problèmes de maths de niveau primaire posés sous forme d'énoncés, chacun demandant plusieurs étapes de raisonnement arithmétique ; le modèle est noté sur le pourcentage de problèmes dont la réponse numérique finale est correcte.

En savoir plus
Exemple
Un court énoncé comme « Natalia a vendu des barrettes à 48 amies en avril et la moitié en mai ; combien de barrettes a-t-elle vendues au total ? » : le modèle doit dérouler les étapes et donner le nombre final.
Notation
Le score est l'accuracy (exactitude) : la proportion de problèmes dont la réponse numérique finale correspond exactement à la réponse de référence ; le raisonnement intermédiaire n'est pas noté, seul le nombre final compte.
Vérification
La vérification est automatique et par correspondance exacte : le nombre final du modèle est extrait (généralement après un séparateur comme « #### ») puis comparé à la bonne réponse, sans jugement humain.
Pourquoi c'est important
Il est devenu un test standard et facile à vérifier du raisonnement en plusieurs étapes, et la célèbre technique de prompting chain-of-thought s'est révélée en améliorer nettement les résultats, ce qui en a fait une mesure courante de la capacité de raisonnement.
Exemple résolu
Tâche
Maria a 3 boîtes de crayons de cire avec 24 crayons dans chaque boîte. Elle donne 15 crayons à son frère, puis achète 2 boîtes pleines de plus. Combien de crayons a-t-elle maintenant ?
Solution
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
Explication
On multiplie pour obtenir le total de départ, on soustrait ce qu'elle donne et on ajoute les boîtes achetées : 72 − 15 + 48 = 105. GSM8K ne note que le nombre final extrait après le délimiteur '####' par correspondance exacte, donc les étapes du raisonnement ne sont pas notées — seul 105 compte.
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
Chronologie
Date Modèle Score Source
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor lance la bêta d'entraînement par volontaires et la RFC de campagne Draft Qwen2.5-7B GSM8K
2026-07-13 Gemma-4-12B 86.0% Flint compresse les traces de raisonnement pour réduire l'utilisation de tokens tout en maintenant la précision
2024-12-17 Falcon3-10B-Base 83.0% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-12-17 Falcon3-7B-Base 79.1% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-12-17 Falcon3-10B-Instruct 83.1% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-07-15 Qwen2-72B 89.5% L'équipe Qwen publie la série Qwen2 avec des modèles denses et MoE de 72B
2024-07-15 Qwen2-72B 89.5% Le rapport technique Qwen2 présente des modèles denses et MoE jusqu'à 72 milliards de paramètres
2024-06-20 Claude 3.5 Sonnet 91.6% Anthropic publie un complément à Claude 3.5 Sonnet avec des benchmarks de codage et de vision améliorés
2024-04-23 DUP method 97.1% Compréhension approfondie des problèmes : la méthode atteint 97,1 % sur GSM8K
2024-03-28 Grok-1.5 90.0% xAI lance Grok-1.5 avec un raisonnement amélioré et un contexte de 128K
2023-03-14 GPT-4 92.0% OpenAI