Benchmark · math

MATH-500

saturated 18 نتائج 17 نماذج

MATH-500 هو مجموعة فرعية من 500 مسألة من مجموعة بيانات رياضيات المسابقات MATH، وهو يختبر قدرة النموذج على حل المسائل الرياضية الصعبة. الدرجة هي النسبة المئوية للمسائل التي يصيب فيها النموذج الإجابة النهائية.

اقرأ المزيد
مثال
العنصر النموذجي هو مسألة رياضية بأسلوب المسابقات — مثل سؤال في الجبر أو الهندسة أو نظرية الأعداد يتطلب إجابة نهائية واحدة (عددًا أو تعبيرًا بصيغة مغلقة) بعد عدة خطوات من الاستدلال.
طريقة التقييم
الدرجة هي نسبة المسائل التي يجيب عنها النموذج بشكل صحيح من أصل 500، أي accuracy = الإجابات النهائية الصحيحة / 500، وتُعبَّر عنها كنسبة مئوية.
التحقق
تُعدّ المسألة محلولة عندما تتطابق الإجابة النهائية للنموذج تمامًا مع الإجابة المرجعية (فحص تكافؤ آلي للإجابة النهائية، وليس للخطوات الوسيطة).
لماذا يهم
إنه مقياس مُوجز وواسع الاستخدام للاستدلال الرياضي يعمل أسرع من مجموعة MATH الكاملة، لذا فهو فحص سريع شائع عند مقارنة نماذج الاستدلال.
مثال محلول
المهمة
من أجل بعض قيم $k$، تكون للمعادلة التربيعية $x^2 - kx + 16 = 0$ جذور صحيحة موجبة فقط. أوجد مجموع جميع القيم الممكنة المختلفة لـ $k$.
الحل
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
الشرح
الجذران $r,s$ عددان صحيحان موجبان حيث $rs=16$ و $k=r+s$؛ أزواج العوامل $(1,16),(2,8),(4,4)$ تعطي $k=17,10,8$، لذا فإن مجموع القيم المختلفة هو $35$. يقيّم MATH-500 بالمطابقة التامة للإجابة النهائية المُطبَّعة داخل \boxed{}، لذا تُقبل $35$ فقط.
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-07 Qwen3.6-27B 87.0% دمج DFlash في llama.cpp يحقق تسارعًا بنسبة 4.44x على Qwen3.6-27B
2026-07-07 Qwen3.6-27B-DFlash 86.0% دمج DFlash في llama.cpp يحقق تسارعًا بنسبة 4.44x على Qwen3.6-27B
2025-08-06 GLM-4.5 98.2% تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
2025-04-30 Phi-4-Mini-Reasoning 3.2% مايكروسوفت تطلق Phi-4-Mini-Reasoning، نموذجًا بحجم 3.8 مليار معلمة يتفوق على نماذج الاستدلال الأكبر حجمًا
2025-04-30 Llama-8B 89.1% مايكروسوفت تطلق Phi-4-Mini-Reasoning، نموذجًا بحجم 3.8 مليار معلمة يتفوق على نماذج الاستدلال الأكبر حجمًا
2025-04-30 Qwen-1.5B 83.9% مايكروسوفت تطلق Phi-4-Mini-Reasoning، نموذجًا بحجم 3.8 مليار معلمة يتفوق على نماذج الاستدلال الأكبر حجمًا
2025-04-15 Gemini 2.0 Flash 90.9% جوجل تطلق Gemini 2.0 Flash بجودة محسّنة وسرعة ضعف سرعة Gemini 1.5 Pro
2025-02-26 Claude 3.7 Sonnet 96.2% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 82.2% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-05 LIMO 94.8% GAIR-NLP تطلق LIMO، محققةً استدلالاً رياضياً قوياً باستخدام 817 عينة
2025-01-22 Kimi k1.5 96.2% كيمي k1.5 يوسع نطاق التعلم المعزز باستخدام نماذج لغوية كبيرة لمواكبة o1 والتفوق على النماذج ذات التفكير القصير
2025-01-22 Kimi k1.5 (short-CoT) 94.6% كيمي k1.5 يوسع نطاق التعلم المعزز باستخدام نماذج لغوية كبيرة لمواكبة o1 والتفوق على النماذج ذات التفكير القصير
2025-01-22 DeepSeek-R1 97.3% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2024-11-28 QwQ-32B-Preview 90.6% Qwen تطلق QwQ-32B-Preview، نموذج استدلال تجريبي
2024-06-20 Claude 3.5 Sonnet 71.1% أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية
2024-03-28 Grok-1.5 50.6% xAI تطلق Grok-1.5 مع تحسين الاستدلال وسياق 128K
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B يحقق 51.7% على معيار MATH باستخدام GRPO وبيانات مختارة