Benchmark · math

AIME 2025

31 نتائج 27 نماذج

يختبر AIME 2025 قدرة النموذج على الاستدلال الرياضي المتقدم باستخدام الأسئلة الخمسة عشر من امتحان American Invitational Mathematics Examination لعام 2025، وهو مسابقة صعبة على مستوى المرحلة الثانوية. كل إجابة عدد صحيح من 0 إلى 999، ودرجة النموذج هي نسبة الأسئلة التي حُلّت بشكل صحيح (تُذكر غالبًا بصيغة pass@1 أو avg@k).

اقرأ المزيد
مثال
المثال النموذجي سؤال مسابقة صعب — مثلاً في نظرية الأعداد أو التوافقيات — تكون إجابته عددًا صحيحًا واحدًا بين 0 و999، كأن يُطلب إيجاد عدد الأزواج المرتبة التي تحقق مجموعة معطاة من الشروط الجبرية.
طريقة التقييم
يُصحَّح كل سؤال من الأسئلة الخمسة عشر بالمطابقة التامة لإجابته العددية الصحيحة، والدرجة هي نسبة (النسبة المئوية) ما حُلّ بشكل صحيح؛ ولأن الإجابات تتغير بين تشغيلٍ وآخر، يُحسب المتوسط عادةً على عيّنات كثيرة (avg@k) أو يُذكر بصيغة pass@1.
التحقق
التحقق آليّ وموضوعي: تُقارن الإجابة العددية النهائية للنموذج بمفتاح الإجابات الرسمي دون درجات جزئية ودون تقييم بشري، فلا يُقبل الحل إلا عند التطابق العددي التام.
لماذا يهم
تتطلب أسئلة AIME استدلالًا إبداعيًا متعدد الخطوات لا الحفظ، لذا يُعدّ هذا المعيار مقياسًا واسع المتابعة لقدرة نماذج LLM الرائدة الرياضية، ورقمًا بارزًا يتكرر ذكره عند إصدار نماذج استدلال جديدة.
مثال محلول
المهمة
مسألة تمثيلية على نمط AIME (الإجابة عدد صحيح من 0 إلى 999): أوجد مجموع كل الأعداد الصحيحة الموجبة n التي يكون من أجلها √(n² + 85n + 2017) عددًا صحيحًا.
الحل
أكمل المربع: (2m)² − (2n+85)² = 843 = 3·281. حلّل فرق المربعين: (2m−2n−85)(2m+2n+85) = 843، ومنه n = 168 أو n = 27. المجموع = 168 + 27 = 195.
الشرح
إكمال المربع يحوّل الشرط إلى فرق مربعين (2m)² − (2n+85)² = 843 = 3·281، وتحليلاته الموجبة الوحيدة تعطي n = 168 و n = 27 بمجموع 195. يُصحَّح AIME بالمطابقة التامة للإجابة الصحيحة الوحيدة (0–999) دون درجات جزئية.
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: نموذج وكيل MoE بحجم 35 مليار معادل للنماذج الأكبر عبر تحسين ما بعد التدريب
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: نموذج MoE الوكيل بـ 35 مليار معلمة يساوي النماذج الأكبر عبر تحسين ما بعد التدريب
2026-07-06 Agents-A1 79.0pts توسيع الأفق وليس المعلمات: بلوغ أداء النليون مع وكيل بحجم 35 مليار
2026-07-05 DASH 50.8% يقلل DASH من الإفراط في التفكير في نماذج اللغة الاستدلالية عبر إسناد الائتمان على مستوى القطع
2026-05-14 o1-pro 86.0% OpenAI تطلق عائلة o1 لتأسيس عصر الاستدلال بحوسبة وقت الاستنتاج
2026-01-27 Kimi K2.5 96.1% مونشوت تطلق Kimi K2.5 بتقنية Agent Swarm
2025-09-30 GLM-4.6 93.9% Zhipu AI تطلق GLM-4.6 بقدرات وكيل ونافذة سياق بحجم 128k
2025-09-30 Claude Sonnet 4.5 100.0% أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
2025-08-07 GPT-5 94.6% أوبن إيه آي تطلق جي بي تي-5 بمنطق تكيفي وهندسة معمارية موحدة
2025-08-07 GPT-5 94.6% OpenAI تطرح GPT-5 بتوجيه موحد واستدلال على مستوى الخبراء
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-07-28 Kimi K2 49.5% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-07-25 Grok 4 88.0% Epoch AI تقيم قدرات Grok 4 في الرياضيات
2025-05-30 Deepseek-R1-0528 87.5% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 يحسّن الاستدلال ودقة AIME إلى 87.5%
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 يُدخل وضع التفكير الموحد ودعمًا لـ 119 لغة
2025-04-17 o4-mini 92.7% OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
2025-04-16 OpenAI o3 98.4% OpenAI تُطلق نماذج o3 و o4-mini للتفكير مع استخدام أدوات ذاتية
2025-04-16 OpenAI o4-mini 99.5% OpenAI تُطلق نماذج o3 و o4-mini للتفكير مع استخدام أدوات ذاتية
2025-03-26 Gemini 2.5 Pro 86.7% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind تطلق نموذج Gemini 2.5 Pro التجريبي
2025-03-11 Grok 3 93.3% xAI تطلق Grok 3 مع الاستدلال العميق وسياق مليون رمز
2025-02-26 Grok 3 Beta 93.3% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 OpenAI o3-mini 83.3% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 DeepSeek R1 79.8% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 Claude 3.7 Sonnet 61.3% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 41.3% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-19 Grok 3 (Think) 93.3% xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2025-01-22 Kimi k1.5 (short-CoT) 60.8% كيمي k1.5 يوسع نطاق التعلم المعزز باستخدام نماذج لغوية كبيرة لمواكبة o1 والتفوق على النماذج ذات التفكير القصير
2025-01-22 Kimi k1.5 77.5% كيمي k1.5 يوسع نطاق التعلم المعزز باستخدام نماذج لغوية كبيرة لمواكبة o1 والتفوق على النماذج ذات التفكير القصير