Benchmark · agentic

SWE-bench Verified

86 نتائج 59 نماذج

يختبر ما إذا كان بإمكان وكيل ذكاء اصطناعي حلّ مسائل (issues) حقيقية من GitHub من البداية إلى النهاية. مجموعة «Verified» هي 500 مهمة تم التحقق منها يدويًا من مستودعات Python مفتوحة المصدر الشهيرة.

اقرأ المزيد
مثال
بالنظر إلى بلاغ عن خطأ وإلى المستودع، على النموذج إنتاج patch للشيفرة — مثلاً إصلاح دالة تحليل تواريخ فاشلة كي تنجح مجموعة اختبارات المشروع.
طريقة التقييم
نسبة المسائل التي تم حلّها — تُذكر عادةً كـ pass@1 (محاولة واحدة). الأعلى أفضل.
التحقق
آليّ بالكامل: يُطبَّق الـ patch المُنتَج وتُشغَّل اختبارات الوحدة الحقيقية المخفية للمشروع داخل صندوق رملي. لا تُحتسب المهمة إلا إذا نجحت كل الاختبارات المستهدفة ولم يتراجع أي شيء آخر.
لماذا يهم
المعيار الرائد لوكلاء البرمجة في العالم الحقيقي ورقمٌ بارز في كل إصدار متقدّم؛ والتقدّم هنا يعكس مدى قرب الوكلاء من هندسة البرمجيات المستقلة.
مثال محلول
المهمة
المستودع django/django عند commit أساسي مثبّت. بلاغ الخطأ: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) يُعيد '___this-is-a-test___'، لكن الشرطات السفلية والشرطات في البداية والنهاية ينبغي إزالتها لتكون النتيجة 'this-is-a-test'. يُعطى النموذج نص المشكلة فقط إضافةً إلى المستودع وعليه إخراج patch بصيغة unified diff.
الحل
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
الشرح
تدمج slugify الفواصل الداخلية لكنها لا تقصّ أبدًا الـ -/_ المحيطة، لذا فإن إلحاق .strip("-_") بالـ re.sub الأخير يزيلها؛ والـ patch أدنى ما يمكن ويحافظ على كل السلوك الآخر. يطبّق SWE-bench Verified الـ patch على المستودع عند الـ commit الأساسي ويقيّم بتشغيل المجموعة المخفية — ولا تنجح إلا إذا تحوّل كل اختبار FAIL_TO_PASS إلى ناجح مع بقاء جميع اختبارات PASS_TO_PASS خضراء.
0 25 50 75 100 2024-08-13 2025-09-05 2026-09-29 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Sonnet 4 · 72.7 · 2025-05-23 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT‑5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Qwen3.5-27B · 74.8 · 2026-08-18 Ornith-1.5 · 86 · 2026-08-19 Ornith-1.5 · 86 · 2026-08-20 Qwen3.5-9B · 14.6 · 2026-08-20 Qwen3.5-9B · 16.6 · 2026-09-02 Granite 4.2 30B · 57 · 2026-08-26 Granite 4.2 8B · 47.7 · 2026-08-26 K2-Horizon-7B · 70.6 · 2026-09-07 K2-Horizon-3.7B · 68.6 · 2026-09-07 Qwen Test agent (post-trained) + Repair agent (post-trained) · 72.6 · 2026-09-09 Qwen Test agent (post-trained) · 62.2 · 2026-09-09 Qwen Test agent (post-trained) · 62.2 · 2026-09-09 GPT-5.6-sol (Test agent) · 65.3 · 2026-09-09 GPT-5.6-sol (Test agent) · 65.3 · 2026-09-09 base Repair agent (no-test baseline) · 61.2 · 2026-09-09 base Repair agent (no-test baseline) · 61.2 · 2026-09-09 base Test agent · 57.3 · 2026-09-09 Qwen Test agent + Repair agent (post-trained) · 72.6 · 2026-09-09 base Test agent (no-test baseline) · 57.3 · 2026-09-09 Ember-1 · 92.2 · 2026-09-28 Qwen3.5-4B (with ROFT) · 49.2 · 2026-09-29 Qwen3.8-Flash-Next Coder · 75.6 · 2026-09-29 Gemini 3.5 Flash · 79 · 2026-09-29 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT-5 GPT‑5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Qwen3.5-27B Ornith-1.5 Qwen3.5-9B Granite 4.2 30B Granite 4.2 8B K2-Horizon-7B K2-Horizon-3.7B Qwen Test agent (post-trained) + Repair agent (post-trained) Qwen Test agent (post-trained) GPT-5.6-sol (Test agent) base Repair agent (no-test baseline) base Test agent Qwen Test agent + Repair agent (post-trained) base Test agent (no-test baseline) Ember-1 Qwen3.5-4B (with ROFT) Qwen3.8-Flash-Next Coder Gemini 3.5 Flash Claude 3.7 Sonnet OpenAI o3
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-09-29 Gemini 3.5 Flash 79.0% أبحاث جوجل تطلق RRSI لمنع الإفراط في التخصيص لحيازة وكلاء الذكاء الاصطناعي
2026-09-29 Qwen3.8-Flash-Next Coder 75.6% إصدار ISTA لنماذج GSQ-RCO GGUF الخاصة بـ Qwen3.8-Flash-Next وإصدار Coder المقتطع بنسبة 50% من الخبراء
2026-09-29 Qwen3.5-4B (with ROFT) 49.2% يحسّن ROFT النماذج الوكيلية عن طريق الضبط الدقيق على الشروحات المولَّدة ذاتياً
2026-09-28 Ember-1 92.2% Fireworks AI تطلق Ember-1، نموذجاً مُدرَّباً بعد التدريب على Kimi K3 باستخدام 40% أقل من الرموز
2026-09-09 Qwen Test agent + Repair agent (post-trained) 72.6% يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 Qwen Test agent (post-trained) 62.2% يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 GPT-5.6-sol (Test agent) 65.3% يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 base Test agent (no-test baseline) 57.3% يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 base Repair agent (no-test baseline) 61.2% يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 Qwen Test agent (post-trained) + Repair agent (post-trained) 72.6% يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 Qwen Test agent (post-trained) 62.2% يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 GPT-5.6-sol (Test agent) 65.3% يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 base Repair agent (no-test baseline) 61.2% يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-09 base Test agent 57.3% يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
2026-09-07 K2-Horizon-7B 70.6% IFM تُصدر K2 Horizon: ستة نماذج Apache 2.0 من 0.9B إلى 375B
2026-09-07 K2-Horizon-3.7B 68.6% IFM تُصدر K2 Horizon: ستة نماذج Apache 2.0 من 0.9B إلى 375B
2026-09-02 Qwen3.5-9B 16.6% CANOPY تمكّن Qwen3-14B من تصدر قائمة AppWorld باستخدام التعزيز المعتمد على النتائج فقط
2026-08-26 Granite 4.2 30B 57.0% إصدار غرانيت 4.2 من آي بي إم مع الاستدلال الأصلي والتعلم المعزز الوكيل للنماذج المؤسسية المفتوحة
2026-08-26 Granite 4.2 8B 47.67% إصدار غرانيت 4.2 من آي بي إم مع الاستدلال الأصلي والتعلم المعزز الوكيل للنماذج المؤسسية المفتوحة
2026-08-20 Qwen3.5-9B 14.6% إطلاق ميتا لموديل ميوز فيديو مع صوت أصلي؛ سترايب تستحوذ على أوبن رويتر
2026-08-20 Ornith-1.5 86.0% Z.ai تقترح قانون قياس ما بعد التدريب وتطلق GLM 5.3؛ Ornith-1.5 ينطلق مع تحسين ذاتي
2026-08-19 Ornith-1.5 86.0% إطلاق Ornith-1.5 لنماذج بحجم 9B و35B-A3B و397B بتدريب ذاتي التحسين
2026-08-18 Qwen3.5-27B 74.8% وكيل كوتشي يحل 374 حالة من SWE-bench Verified باستخدام Qwen3.5-27B
2026-08-10 Qwen3.6-27B 77.2% إطلاق ميتا لـ Muse Glimmer، نموذج وكيل بوزن مفتوح يتكون من 30 مليار معلمة ويعمل على بطاقة رسوميات استهلاكية واحدة
2026-08-03 Orchard-SWE 69.7% أبحاث مايكروسوفت تطلق إطار عمل Orchard للذكاء الاصطناعي الوكيل القابل للتوسع
2026-08-03 Inkling-Small 80.2% مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
2026-07-24 Claude Opus 5 96.0% أنثروبيك تطلق كلود أوبوس 5 مع التفكير الافتراضي وتحسينات البرمجة الوكيلية
2026-07-19 DeepSeek V4 Pro 80.6% مقارنة بين Kimi K3 وDeepSeek V4 Pro وGLM-5.2 من حيث المقاييس، الترخيص، وتكلفة التشغيل
2026-07-17 Devstral 2 72.2% مسترال فايب للكود يقود أربعة وكلاء برمجة في مهمة من الهيكل إلى طلب السحب
2026-07-17 Devstral Small 2 68.0% مسترال فايب للكود يقود أربعة وكلاء برمجة في مهمة من الهيكل إلى طلب السحب
2026-07-14 Qwen3.5-35B-A3B 6.0% إعادة ضبط UMoE لمجموعات خبراء MoE لتحسين الضبط الدقيق الخاص بالقطاع
2026-07-14 Qwen3-30B-A3B 6.0% إعادة ضبط UMoE لمجموعات خبراء MoE لتحسين الضبط الدقيق الخاص بالقطاع
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier يقدم إطار عمل تحقق عام مع تقييم مستمر
2026-04-25 Qwen3.6-27B 77.2% أليبا تطلق Qwen3.6-27B، متفوقةً على سلفها الأكبر في معايير الترميز
2026-04-24 V4-Pro-Max 80.6% ديب سيك تطلق الإصدار الرابع بهندسة سياق طويل فعّالة للوكلاء
2026-03-25 o3 71.7% OpenAI تعلن عن تقاعد نموذج o3 من ChatGPT وتشارك نتائج الاختبارات المرجعية
2026-02-17 Claude Sonnet 4.6 79.6% أنثروبيك تطلق كلاود سونيت 4.6 مع تحسينات في البرمجة واستخدام الكمبيوتر وسياق يتكون من مليون توكن
2026-02-05 Claude Opus 4.6 80.8% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2026-02-01 Claude Opus 4.6 80.8% تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة
2026-02-01 MiniMax M2.5 80.2% تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B وDeepSeek V4 Flash يتصدران معايير الترميز المحلي
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI تطلق GPT-5.2، متفوقة على Gemini 3 في معايير البرمجة والاستدلال
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI تطرح GPT-5.2 بقدرات عمل معرفي احترافي متقدمة
2025-12-09 Devstral 2 72.2% Mistral تطلق نماذج Devstral 2 للبرمجة وواجهة سطر الأوامر Mistral Vibe CLI
2025-12-09 Devstral Small 2 68.0% Mistral تطلق نماذج Devstral 2 للبرمجة وواجهة سطر الأوامر Mistral Vibe CLI
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI تجعل GPT-5.1-Codex-Max الافتراضي في Codex CLI
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI تطلق Kimi K2 Thinking مع استخدام الأدوات الوكيلية
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-09-30 Claude Sonnet 4.5 77.2% أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT-5 74.9% OpenAI تطلق GPT-5 الموحّد مع التوجيه في الوقت الفعلي ووصول مجاني
2025-08-07 GPT‑5 74.9% OpenAI تطلق واجهة برمجة تطبيقات GPT-5 بتحسينات في البرمجة والوكلاء
2025-08-07 GPT-5 74.9% OpenAI تطرح GPT-5 بتوجيه موحد واستدلال على مستوى الخبراء
2025-08-07 GPT-5 74.9% أوبن إيه آي تطلق جي بي تي-5 بمنطق تكيفي وهندسة معمارية موحدة
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
2025-07-28 Kimi K2 65.8% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-07-28 Kimi K2 65.8% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI تطلق Kimi-K2-Instruct، نموذج MoE بـ 1 تريليون معلمة مع قدرات وكيلة
2025-07-11 Kimi K2 65.8% Moonshot AI تطلق Kimi K2، نموذج MoE بـ 1T معلمة مع قدرات وكيلية
2025-07-10 Devstral Medium 61.6% Mistral AI تطلق Devstral Small 1.1 وDevstral Medium بالتعاون مع All Hands AI
2025-07-10 Devstral Small 1.1 53.6% Mistral AI تطلق Devstral Small 1.1 وDevstral Medium بالتعاون مع All Hands AI
2025-05-30 Deepseek-R1-0528 57.6% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-23 Claude Sonnet 4 72.7% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
2025-05-23 Claude Opus 4 72.5% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI تُطلق نموذج Devstral اللغوي الكبير الوكيلية لهندسة البرمجيات
2025-04-17 o4-mini 68.1% OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI تطلق عائلة GPT-4.1 مع سياق يتكون من مليون توكن وتحسينات في البرمجة
2025-04-14 GPT‑4.1 54.6% OpenAI تُطلق GPT-4.1 وGPT-4.1 mini وGPT-4.1 nano عبر واجهة برمجة التطبيقات
2025-03-26 Gemini 2.5 Pro 63.8% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-25 Gemini 2.5 Pro 63.8% جوجل تقدم النموذج التجريبي Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% جوجل تطرح نموذج التفكير جيمينى 2.5 برو
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI تطلق GPT-4.5، أكبر نموذج لها، لـ ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet يحقق 49% على SWE-bench Verified
2024-12-20 o3 71.7% OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
2024-12-20 o3 71.7% OpenAI تستعرض نموذج o3 للاستدلال مع إنجازات في ARC AGI و Frontier Math
2024-10-30 Claude 3.5 Sonnet 49.0% حقق Claude 3.5 Sonnet نتيجة بنسبة 49% على SWE-bench Verified مع الحد الأدنى من الهيكل المساعد
2024-10-22 Claude 3.5 Sonnet 49.0% أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"
2024-10-22 Claude 3.5 Haiku 40.6% أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI تطلق مجموعة SWE-bench Verified الفرعية المُتحقق منها من قبل البشر
2024-08-13 GPT‑4o 33.2% OpenAI تطلق مجموعة SWE-bench Verified الفرعية المُتحقق منها من قبل البشر