Benchmark · coding

LiveCodeBench

25 نتائج 23 نماذج

يقيّم LiveCodeBench مدى قدرة نماذج اللغة الكبيرة على حل مسائل competitive programming، باستخدام تحديات برمجية تُجمع باستمرار من المسابقات الحديثة لتجنّب تلوّث بيانات التدريب. المقياس الرئيسي هو pass@1، أي نسبة المسائل التي يحلّها النموذج بشكل صحيح من المحاولة الأولى.

اقرأ المزيد
مثال
المثال النموذجي هو مسألة برمجية بأسلوب المسابقات — على سبيل المثال، بمعطى مصفوفة من الأعداد الصحيحة، كتابة دالة تُعيد طول أطول متتالية جزئية متزايدة تمامًا — يجب على النموذج حلّها عبر توليد كود يعمل فعليًا.
طريقة التقييم
يُشغَّل كل حل مُولَّد على حالات اختبار المسألة؛ وpass@1 هو نسبة المسائل التي يجتاز فيها أول إرسال للنموذج جميع الاختبارات.
التحقق
يُقبل الحل تلقائيًا عندما يجتاز الكود المُولَّد جميع حالات الاختبار المخفية والعلنية لتلك المسألة؛ دون أي تقييم بشري أو مطابقة نصية دقيقة.
لماذا يهم
بما أنّ مسائله مأخوذة من مسابقات صدرت بعد تاريخ انتهاء تدريب النموذج، فإنّ LiveCodeBench يقيس قدرة حقيقية على الاستدلال والبرمجة بدلاً من إجابات محفوظة، ما يجعله مؤشرًا موثوقًا ومقاوِمًا للتلوّث لمهارة البرمجة.
مثال محلول
المهمة
بأسلوب البرمجة التنافسية (stdin/stdout). بمعطى n عددًا صحيحًا، احسب عدد الأزواج (i, j) حيث i < j بحيث يكون nums[i] + nums[j] زوجيًا. المدخلات: السطر الأول n، والسطر الثاني n أعدادًا صحيحة مفصولة بمسافات؛ اطبع العدد.
الحل
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
الشرح
يكون المجموع زوجيًا فقط عندما يكون للحدّين التكافؤ نفسه، لذا فالجواب هو C(evens, 2) + C(odds, 2)؛ وحساب التكافؤ يجري بزمن O(n). يشغّل LiveCodeBench برنامج النموذج على اختبارات وحدة مخفية ويقيّمه بمقياس pass@1 — صحيح فقط إذا نجحت كل الاختبارات.
0 23 46 69 92 2024-07-15 2025-08-22 2026-09-29 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) · 66.5 · 2026-08-25 30B base models with PLVR · 27.8 · 2026-08-31 Qwen3.8-Flash-Next (IQ3_S) · 86.9 · 2026-09-29 Qwen3.8-Flash-Next (IQ3_XXS) · 86.3 · 2026-09-29 Qwen3.8-Flash-Next Coder · 86.3 · 2026-09-29
Qwen2-72B-Instruct QwQ-32B-Preview Kimi k1.5 (short-CoT) DeepSeek-R1-Distill-Qwen-32B Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) 30B base models with PLVR Qwen3.8-Flash-Next (IQ3_S) Qwen3.8-Flash-Next (IQ3_XXS) Qwen3.8-Flash-Next Coder
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-09-29 Qwen3.8-Flash-Next (IQ3_S) 86.86% إصدار ISTA لنماذج GSQ-RCO GGUF الخاصة بـ Qwen3.8-Flash-Next وإصدار Coder المقتطع بنسبة 50% من الخبراء
2026-09-29 Qwen3.8-Flash-Next (IQ3_XXS) 86.29% إصدار ISTA لنماذج GSQ-RCO GGUF الخاصة بـ Qwen3.8-Flash-Next وإصدار Coder المقتطع بنسبة 50% من الخبراء
2026-09-29 Qwen3.8-Flash-Next Coder 86.28% إصدار ISTA لنماذج GSQ-RCO GGUF الخاصة بـ Qwen3.8-Flash-Next وإصدار Coder المقتطع بنسبة 50% من الخبراء
2026-08-31 30B base models with PLVR 27.8% يستخدم PLVR الانتشار العكسي الرمزي لتعلم برامج استدلالية قابلة للتحقق
2026-08-25 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) 66.5% تقنية QAH من Multiverse Computing تجعل نموذج GPT-OSS بدقة 4 بت يتفوق على نسخته الكاملة الدقة
2026-07-06 Agents-A1 44.3pts توسيع الأفق وليس المعلمات: بلوغ أداء النليون مع وكيل بحجم 35 مليار
2026-02-25 Grok 4 81.9% xAI تطلق نموذج Grok 4 للاستدلال بمعايير قوية للوكلاء والبرمجة
2026-02-10 Step 3.5 Flash 86.4% الخطوة 3.5 فلاش: نموذج MoE النشط بـ 11 مليار معلمة يحقق أداءً وكيلاً على المستوى المتقدم
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-09-30 GLM-4.6 82.8% Zhipu AI تطلق GLM-4.6 بقدرات وكيل ونافذة سياق بحجم 128k
2025-07-28 Kimi K2 53.7% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-07-28 Kimi K2 53.7% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-05-30 Deepseek-R1-0528 73.3% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 يُدخل وضع التفكير الموحد ودعمًا لـ 119 لغة
2025-04-15 Gemini 2.0 Flash 34.5% جوجل تطلق Gemini 2.0 Flash بجودة محسّنة وسرعة ضعف سرعة Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 70.4% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 يحسّن الاستدلال والبرمجة والكتابة الصينية مقارنة بـ DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI تطلق Grok 3 مع الاستدلال العميق وسياق مليون رمز
2025-02-19 Grok 3 (Think) 79.4% xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2025-02-19 Grok 3 mini 80.4% xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2025-01-22 Kimi k1.5 (short-CoT) 47.3% كيمي k1.5 يوسع نطاق التعلم المعزز باستخدام نماذج لغوية كبيرة لمواكبة o1 والتفوق على النماذج ذات التفكير القصير
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% ديب سيك تطلق نماذج استدلالية R1 عبر التعلم التعزيزي
2024-11-28 QwQ-32B-Preview 50.0% Qwen تطلق QwQ-32B-Preview، نموذج استدلال تجريبي
2024-07-15 Qwen2-72B-Instruct 35.7% فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار
2024-07-15 Qwen2-72B-Instruct 35.7% تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة