Benchmark · math

AIME 2024

30 نتائج 27 نماذج

يقيس AIME 2024 القدرة المتقدمة على الاستدلال الرياضي لدى النموذج باستخدام الـ 15 مسألة من American Invitational Mathematics Examination لعام 2024، ويذكر النسبة المئوية للمسائل المحلولة بشكل صحيح.

اقرأ المزيد
مثال
المسألة النموذجية هي مسألة مسابقة صعبة بمستوى المدرسة الثانوية — مثلاً في نظرية الأعداد أو التوافقيات — يكون جوابها عدداً صحيحاً واحداً (جواب AIME دائماً عدد صحيح، عادةً بين 0 و999).
طريقة التقييم
المقياس هو الدقة: نسبة المسائل المُجابة بشكل صحيح من أصل 15، بحيث تساوي كل مسألة محلولة 1/15 من الدرجة.
التحقق
يُقبل الناتج بالتطابق التام: يجب أن يساوي العدد الصحيح النهائي للنموذج الجوابَ الرسمي، ويُتحقق منه آلياً دون درجات جزئية ودون تقييم بشري.
لماذا يهم
لأنه مجموعة صغيرة من مسائل المسابقات الصعبة والحديثة التي تتطلب استدلالاً متعدد الخطوات، يُستخدم على نطاق واسع لمقارنة النماذج المتقدمة، وحداثته تقلّل من تلوث بيانات التدريب.
مثال محلول
المهمة
كم عدداً صحيحاً موجباً n ≤ 600 يقبل القسمة على 4 أو 6 لكن لا يقبل القسمة على 5؟ (إجابات AIME أعداد صحيحة من 0 إلى 999.)
الحل
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
الشرح
بمبدأ الاحتواء والاستبعاد، هناك 200 عدد يقبل القسمة على 4 أو 6، منها 40 يقبل القسمة على 5 أيضاً، فيتبقى 160. يصحّح AIME تلقائياً العدد الصحيح النهائي فقط (0–999) دون درجات جزئية.
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-07 Qwen3-1.7B 62.4% يقوم Direct-OPD بتكثيف مكاسب التعلم المعزز من الضعيف إلى القوي لنماذج أقوى
2026-03-25 o3 96.7% OpenAI تعلن عن تقاعد نموذج o3 من ChatGPT وتشارك نتائج الاختبارات المرجعية
2025-08-06 GLM-4.5 91.0% تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
2025-08-06 GLM-4.5-Air 89.4% تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
2025-06-12 Magistral Medium 50.0% مسترال تطرح نماذج استنتاج ماجسترال بخط أنابيب تعزيزي قابل للتوسع
2025-06-10 Magistral Small 70.7% مسترال آي إيه تطلق نموذج Magistral للاستدلال مع إصدارات مفتوحة ومؤسساتية
2025-06-10 Magistral Medium 73.6% مسترال آي إيه تطلق نموذج Magistral للاستدلال مع إصدارات مفتوحة ومؤسساتية
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-30 Deepseek-R1-0528 91.4% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 يُدخل وضع التفكير الموحد ودعمًا لـ 119 لغة
2025-04-17 o4-mini 93.4% OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% يستخدم Seed1.5-Thinking التعلم بالتعزيز لتحسين الاستدلال
2025-03-26 Gemini 2.5 Pro 92.0% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 يحسّن الاستدلال والبرمجة والكتابة الصينية مقارنة بـ DeepSeek-V3
2025-03-05 GPT-4.5 36.7% OpenAI تطلق GPT-4.5، أكبر نموذج لها، لـ ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 80.0% أنثروبيك تطلق كلاود 3.7 سونيت مع تحكم ديناميكي في التفكير
2025-02-19 Grok 3 mini 95.8% xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2025-02-05 LIMO 57.1% GAIR-NLP تطلق LIMO، محققةً استدلالاً رياضياً قوياً باستخدام 817 عينة
2025-01-31 s1-32B 57.0% مختبر البساطة في التوسع يُصدر s1-32B مع توسع وقت الاختبار عبر فرض الميزانية
2025-01-31 s1-32B 57.0% يتفوق s1-32B على o1-preview في الرياضيات التنافسية باستخدام قياس زمني بسيط للاختبار
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2025-01-22 DeepSeek-R1-Zero 71.0% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2025-01-22 DeepSeek-R1 79.8% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
2024-11-28 QwQ-32B-Preview 50.0% Qwen تطلق QwQ-32B-Preview، نموذج استدلال تجريبي
2024-10-01 OpenAI o1-preview 83.0% مقارنة نموذج OpenAI o1 مع النماذج الرائدة الأخرى
2024-09-12 o1 13.9% OpenAI تُطلق o1-preview، نموذج استدلال يتفوق على الخبراء البشريين في اختبارات الرياضيات والعلوم