Benchmark · coding

LiveCodeBench

20 نتائج 18 نماذج

يقيّم LiveCodeBench مدى قدرة نماذج اللغة الكبيرة على حل مسائل competitive programming، باستخدام تحديات برمجية تُجمع باستمرار من المسابقات الحديثة لتجنّب تلوّث بيانات التدريب. المقياس الرئيسي هو pass@1، أي نسبة المسائل التي يحلّها النموذج بشكل صحيح من المحاولة الأولى.

اقرأ المزيد
مثال
المثال النموذجي هو مسألة برمجية بأسلوب المسابقات — على سبيل المثال، بمعطى مصفوفة من الأعداد الصحيحة، كتابة دالة تُعيد طول أطول متتالية جزئية متزايدة تمامًا — يجب على النموذج حلّها عبر توليد كود يعمل فعليًا.
طريقة التقييم
يُشغَّل كل حل مُولَّد على حالات اختبار المسألة؛ وpass@1 هو نسبة المسائل التي يجتاز فيها أول إرسال للنموذج جميع الاختبارات.
التحقق
يُقبل الحل تلقائيًا عندما يجتاز الكود المُولَّد جميع حالات الاختبار المخفية والعلنية لتلك المسألة؛ دون أي تقييم بشري أو مطابقة نصية دقيقة.
لماذا يهم
بما أنّ مسائله مأخوذة من مسابقات صدرت بعد تاريخ انتهاء تدريب النموذج، فإنّ LiveCodeBench يقيس قدرة حقيقية على الاستدلال والبرمجة بدلاً من إجابات محفوظة، ما يجعله مؤشرًا موثوقًا ومقاوِمًا للتلوّث لمهارة البرمجة.
مثال محلول
المهمة
بأسلوب البرمجة التنافسية (stdin/stdout). بمعطى n عددًا صحيحًا، احسب عدد الأزواج (i, j) حيث i < j بحيث يكون nums[i] + nums[j] زوجيًا. المدخلات: السطر الأول n، والسطر الثاني n أعدادًا صحيحة مفصولة بمسافات؛ اطبع العدد.
الحل
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
الشرح
يكون المجموع زوجيًا فقط عندما يكون للحدّين التكافؤ نفسه، لذا فالجواب هو C(evens, 2) + C(odds, 2)؛ وحساب التكافؤ يجري بزمن O(n). يشغّل LiveCodeBench برنامج النموذج على اختبارات وحدة مخفية ويقيّمه بمقياس pass@1 — صحيح فقط إذا نجحت كل الاختبارات.
0 23 46 69 92 2024-07-15 2025-07-10 2026-07-06 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-06 Agents-A1 44.3pts توسيع الأفق وليس المعلمات: بلوغ أداء النليون مع وكيل بحجم 35 مليار
2026-02-25 Grok 4 81.9% xAI تطلق نموذج Grok 4 للاستدلال بمعايير قوية للوكلاء والبرمجة
2026-02-10 Step 3.5 Flash 86.4% الخطوة 3.5 فلاش: نموذج MoE النشط بـ 11 مليار معلمة يحقق أداءً وكيلاً على المستوى المتقدم
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-09-30 GLM-4.6 82.8% Zhipu AI تطلق GLM-4.6 بقدرات وكيل ونافذة سياق بحجم 128k
2025-07-28 Kimi K2 53.7% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-07-28 Kimi K2 53.7% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-05-30 Deepseek-R1-0528 73.3% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 يُدخل وضع التفكير الموحد ودعمًا لـ 119 لغة
2025-04-15 Gemini 2.0 Flash 34.5% جوجل تطلق Gemini 2.0 Flash بجودة محسّنة وسرعة ضعف سرعة Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 70.4% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 يحسّن الاستدلال والبرمجة والكتابة الصينية مقارنة بـ DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI تطلق Grok 3 مع الاستدلال العميق وسياق مليون رمز
2025-02-19 Grok 3 (Think) 79.4% xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2025-02-19 Grok 3 mini 80.4% xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2025-01-22 Kimi k1.5 (short-CoT) 47.3% كيمي k1.5 يوسع نطاق التعلم المعزز باستخدام نماذج لغوية كبيرة لمواكبة o1 والتفوق على النماذج ذات التفكير القصير
2024-11-28 QwQ-32B-Preview 50.0% Qwen تطلق QwQ-32B-Preview، نموذج استدلال تجريبي
2024-07-15 Qwen2-72B-Instruct 35.7% فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار
2024-07-15 Qwen2-72B-Instruct 35.7% تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة