Benchmark · math

GSM8K

saturated 11 نتائج 10 نماذج

GSM8K (Grade School Math 8K) هو معيار لمسائل رياضيات لفظية بمستوى المرحلة الابتدائية، تتطلب كل منها عدة خطوات من الاستدلال الحسابي لحلها؛ ويُقيَّم النموذج بنسبة المسائل التي تكون إجابتها الرقمية النهائية صحيحة.

اقرأ المزيد
مثال
مسألة لفظية قصيرة مثل «باعت Natalia مشابك لـ 48 صديقة في أبريل ونصف ذلك في مايو؛ كم مشبكًا باعت إجمالًا؟» — على النموذج أن يتدرّج في الخطوات ويعطي الرقم النهائي.
طريقة التقييم
الدرجة هي accuracy (الدقة): نسبة المسائل التي تطابق إجابتها الرقمية النهائية الإجابة المرجعية تمامًا؛ ولا يُقيَّم الاستدلال الوسيط، بل الرقم النهائي فقط.
التحقق
التحقق آلي وبالمطابقة التامة: يُستخرج الرقم النهائي من النموذج (عادةً بعد فاصل مثل «####») ويُقارن بالإجابة الصحيحة، فلا حاجة إلى حكم بشري.
لماذا يهم
أصبح اختبارًا قياسيًا وسهل التحقق للاستدلال متعدد الخطوات، وقد تبيّن أن أسلوب التوجيه الشهير chain-of-thought يحسّن نتائجه بوضوح، مما جعله مقياسًا شائعًا للقدرة على الاستدلال.
مثال محلول
المهمة
لدى ماريا 3 علب من أقلام التلوين، في كل علبة 24 قلمًا. تعطي أخاها 15 قلمًا، ثم تشتري علبتين ممتلئتين إضافيتين. كم قلم تلوين لديها الآن؟
الحل
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
الشرح
نضرب للحصول على العدد الأولي، ونطرح ما أعطته، ونضيف العلب المشتراة حديثًا: 72 − 15 + 48 = 105. يقيّم GSM8K فقط الرقم النهائي المستخرج بعد الفاصل '####' بالمطابقة التامة، لذا لا تُقيَّم خطوات الاستدلال — يُحتسب 105 فقط.
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor يُطلق النسخة التجريبية لتدريب المتطوعين وطلب التعليقات حول حملة Qwen2.5-7B GSM8K
2026-07-13 Gemma-4-12B 86.0% تضغط Flint مسارات الاستدلال لتقليل استخدام الرموز مع الحفاظ على الدقة
2024-12-17 Falcon3-10B-Base 83.0% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-12-17 Falcon3-7B-Base 79.1% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-12-17 Falcon3-10B-Instruct 83.1% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-07-15 Qwen2-72B 89.5% فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار
2024-07-15 Qwen2-72B 89.5% تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة
2024-06-20 Claude 3.5 Sonnet 91.6% أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية
2024-04-23 DUP method 97.1% الفهم العميق للمشكلات: يحقق الأسلوب 97.1% على GSM8K
2024-03-28 Grok-1.5 90.0% xAI تطلق Grok-1.5 مع تحسين الاستدلال وسياق 128K
2023-03-14 GPT-4 92.0% OpenAI