Benchmark · coding

Codeforces (Elo)

10 نتائج 10 نماذج

يقيس Codeforces (Elo) قدرة النموذج على البرمجة التنافسية بجعله يحل مسائل مسابقات محدّدة بوقت، ويُعبَّر عن النتيجة بتصنيف Codeforces Elo (نحو 0–4000، حيث يُعدّ ما يقارب 2000 فأكثر مستوى قويًا).

اقرأ المزيد
مثال
المسألة النموذجية هي مسألة خوارزمية محدّدة بوقت — مثلًا قراءة مدخلات المسألة وطباعة الإجابة الصحيحة ضمن حدود صارمة للوقت والذاكرة، باستخدام تقنيات مثل البحث في الرسوم البيانية (graph search) أو البرمجة الديناميكية أو الخوارزميات الجشعة (greedy).
طريقة التقييم
النتيجة رقم Elo واحد يُحسب من عدد مسائل المسابقات التي يحلّها النموذج ومدى صعوبتها، ويوضع على مقياس التصنيف نفسه الذي يستخدمه Codeforces للمتسابقين البشر.
التحقق
يُقيَّم كل حلّ مُرسَل تلقائيًا: يُجمَّع الكود (compile) ويُشغَّل على مجموعة مخفية من حالات الاختبار، ولا يُحتسب محلولًا إلا إذا أنتج المخرجات الصحيحة ضمن حدود الوقت والذاكرة.
لماذا يهم
يعكس الاستدلال الخوارزمي متعدد الخطوات والقدرة على كتابة كود صحيح وفعّال ضمن قيود، ويُسقِط مهارة البرمجة لدى النموذج على مقياس تصنيف يفهمه الناس مسبقًا.
مثال محلول
المهمة
Watermelon: بالنظر إلى عدد صحيح w (1 ≤ w ≤ 100) يمثّل وزن بطيخة، حدّد ما إذا كان يمكن تقسيمها إلى جزأين بحيث يزن كل جزء عددًا زوجيًا موجبًا من الكيلوغرامات. اطبع «YES» أو «NO».
الحل
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
الشرح
مجموع عددين زوجيين موجبين هو نفسه زوجي ولا يقل عن 4، لذا يوجد تقسيم صحيح تمامًا عندما يكون w زوجيًا و w > 2 (مثال: w=8 → 2+6). يقوم Codeforces بالتقييم عبر ترجمة الحل وتشغيله على حالات اختبار مخفية، مع اشتراط مطابقة مخرجات stdout تمامًا ضمن حدود الوقت والذاكرة.
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-16 GFlowRL 2048.0Elo مايكروسوفت تطلق GFlowRL، وهو تعلم معزز مستقر على نمط GFlowNet للنماذج اللغوية الكبيرة
2026-02-12 Gemini 3 Deep Think 3455.0Elo جوجل تطلق نسخة مطورة من Gemini 3 Deep Think بنتائج معايير جديدة
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 يُدخل وضع التفكير الموحد ودعمًا لـ 119 لغة
2025-04-17 o4-mini 2719.0Elo OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
2025-01-22 DeepSeek-R1 2029.0Elo ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo يقدم معياراً لتوليد الأكواد على مستوى المسابقات بتقييمات إيلو قابلة للمقارنة مع البشر
2025-01-02 o1-mini 1578.0Elo CodeElo يقدم معياراً لتوليد الأكواد على مستوى المسابقات بتقييمات إيلو قابلة للمقارنة مع البشر
2024-12-20 o3 2727.0Elo OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
2024-10-01 OpenAI o1-preview 89.0Elo مقارنة نموذج OpenAI o1 مع النماذج الرائدة الأخرى
2024-09-12 o1 1807.0Elo OpenAI تُطلق o1-preview، نموذج استدلال يتفوق على الخبراء البشريين في اختبارات الرياضيات والعلوم