Benchmark · agentic

SWE-bench Verified

63 نتائج 41 نماذج

يختبر ما إذا كان بإمكان وكيل ذكاء اصطناعي حلّ مسائل (issues) حقيقية من GitHub من البداية إلى النهاية. مجموعة «Verified» هي 500 مهمة تم التحقق منها يدويًا من مستودعات Python مفتوحة المصدر الشهيرة.

اقرأ المزيد
مثال
بالنظر إلى بلاغ عن خطأ وإلى المستودع، على النموذج إنتاج patch للشيفرة — مثلاً إصلاح دالة تحليل تواريخ فاشلة كي تنجح مجموعة اختبارات المشروع.
طريقة التقييم
نسبة المسائل التي تم حلّها — تُذكر عادةً كـ pass@1 (محاولة واحدة). الأعلى أفضل.
التحقق
آليّ بالكامل: يُطبَّق الـ patch المُنتَج وتُشغَّل اختبارات الوحدة الحقيقية المخفية للمشروع داخل صندوق رملي. لا تُحتسب المهمة إلا إذا نجحت كل الاختبارات المستهدفة ولم يتراجع أي شيء آخر.
لماذا يهم
المعيار الرائد لوكلاء البرمجة في العالم الحقيقي ورقمٌ بارز في كل إصدار متقدّم؛ والتقدّم هنا يعكس مدى قرب الوكلاء من هندسة البرمجيات المستقلة.
مثال محلول
المهمة
المستودع django/django عند commit أساسي مثبّت. بلاغ الخطأ: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) يُعيد '___this-is-a-test___'، لكن الشرطات السفلية والشرطات في البداية والنهاية ينبغي إزالتها لتكون النتيجة 'this-is-a-test'. يُعطى النموذج نص المشكلة فقط إضافةً إلى المستودع وعليه إخراج patch بصيغة unified diff.
الحل
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
الشرح
تدمج slugify الفواصل الداخلية لكنها لا تقصّ أبدًا الـ -/_ المحيطة، لذا فإن إلحاق .strip("-_") بالـ re.sub الأخير يزيلها؛ والـ patch أدنى ما يمكن ويحافظ على كل السلوك الآخر. يطبّق SWE-bench Verified الـ patch على المستودع عند الـ commit الأساسي ويقيّم بتشغيل المجموعة المخفية — ولا تنجح إلا إذا تحوّل كل اختبار FAIL_TO_PASS إلى ناجح مع بقاء جميع اختبارات PASS_TO_PASS خضراء.
0 25 50 75 100 2024-08-13 2025-08-11 2026-08-10 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-10 Qwen3.6-27B 77.2% إطلاق ميتا لـ Muse Glimmer، نموذج وكيل بوزن مفتوح يتكون من 30 مليار معلمة ويعمل على بطاقة رسوميات استهلاكية واحدة
2026-08-03 Orchard-SWE 69.7% أبحاث مايكروسوفت تطلق إطار عمل Orchard للذكاء الاصطناعي الوكيل القابل للتوسع
2026-08-03 Inkling-Small 80.2% مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
2026-07-24 Claude Opus 5 96.0% أنثروبيك تطلق كلود أوبوس 5 مع التفكير الافتراضي وتحسينات البرمجة الوكيلية
2026-07-19 DeepSeek V4 Pro 80.6% مقارنة بين Kimi K3 وDeepSeek V4 Pro وGLM-5.2 من حيث المقاييس، الترخيص، وتكلفة التشغيل
2026-07-17 Devstral Small 2 68.0% مسترال فايب للكود يقود أربعة وكلاء برمجة في مهمة من الهيكل إلى طلب السحب
2026-07-17 Devstral 2 72.2% مسترال فايب للكود يقود أربعة وكلاء برمجة في مهمة من الهيكل إلى طلب السحب
2026-07-14 Qwen3.5-35B-A3B 6.0% إعادة ضبط UMoE لمجموعات خبراء MoE لتحسين الضبط الدقيق الخاص بالقطاع
2026-07-14 Qwen3-30B-A3B 6.0% إعادة ضبط UMoE لمجموعات خبراء MoE لتحسين الضبط الدقيق الخاص بالقطاع
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier يقدم إطار عمل تحقق عام مع تقييم مستمر
2026-04-25 Qwen3.6-27B 77.2% أليبا تطلق Qwen3.6-27B، متفوقةً على سلفها الأكبر في معايير الترميز
2026-04-24 V4-Pro-Max 80.6% ديب سيك تطلق الإصدار الرابع بهندسة سياق طويل فعّالة للوكلاء
2026-03-25 o3 71.7% OpenAI تعلن عن تقاعد نموذج o3 من ChatGPT وتشارك نتائج الاختبارات المرجعية
2026-02-17 Claude Sonnet 4.6 79.6% أنثروبيك تطلق كلاود سونيت 4.6 مع تحسينات في البرمجة واستخدام الكمبيوتر وسياق يتكون من مليون توكن
2026-02-05 Claude Opus 4.6 80.8% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2026-02-01 Claude Opus 4.6 80.8% تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة
2026-02-01 MiniMax M2.5 80.2% تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B وDeepSeek V4 Flash يتصدران معايير الترميز المحلي
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI تطرح GPT-5.2 بقدرات عمل معرفي احترافي متقدمة
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI تطلق GPT-5.2، متفوقة على Gemini 3 في معايير البرمجة والاستدلال
2025-12-09 Devstral 2 72.2% Mistral تطلق نماذج Devstral 2 للبرمجة وواجهة سطر الأوامر Mistral Vibe CLI
2025-12-09 Devstral Small 2 68.0% Mistral تطلق نماذج Devstral 2 للبرمجة وواجهة سطر الأوامر Mistral Vibe CLI
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI تجعل GPT-5.1-Codex-Max الافتراضي في Codex CLI
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI تطلق Kimi K2 Thinking مع استخدام الأدوات الوكيلية
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-09-30 Claude Sonnet 4.5 77.2% أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI تطلق واجهة برمجة تطبيقات GPT-5 بتحسينات في البرمجة والوكلاء
2025-08-07 GPT-5 74.9% أوبن إيه آي تطلق جي بي تي-5 بمنطق تكيفي وهندسة معمارية موحدة
2025-08-07 GPT-5 74.9% OpenAI تطلق GPT-5 الموحّد مع التوجيه في الوقت الفعلي ووصول مجاني
2025-08-07 GPT-5 74.9% OpenAI تطرح GPT-5 بتوجيه موحد واستدلال على مستوى الخبراء
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
2025-07-28 Kimi K2 65.8% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-07-28 Kimi K2 65.8% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI تطلق Kimi-K2-Instruct، نموذج MoE بـ 1 تريليون معلمة مع قدرات وكيلة
2025-07-11 Kimi K2 65.8% Moonshot AI تطلق Kimi K2، نموذج MoE بـ 1T معلمة مع قدرات وكيلية
2025-07-10 Devstral Medium 61.6% Mistral AI تطلق Devstral Small 1.1 وDevstral Medium بالتعاون مع All Hands AI
2025-07-10 Devstral Small 1.1 53.6% Mistral AI تطلق Devstral Small 1.1 وDevstral Medium بالتعاون مع All Hands AI
2025-05-30 Deepseek-R1-0528 57.6% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-23 Claude Opus 4 72.5% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
2025-05-23 Claude Sonnet 4 72.7% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI تُطلق نموذج Devstral اللغوي الكبير الوكيلية لهندسة البرمجيات
2025-04-17 o4-mini 68.1% OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI تطلق عائلة GPT-4.1 مع سياق يتكون من مليون توكن وتحسينات في البرمجة
2025-04-14 GPT‑4.1 54.6% OpenAI تُطلق GPT-4.1 وGPT-4.1 mini وGPT-4.1 nano عبر واجهة برمجة التطبيقات
2025-03-26 Gemini 2.5 Pro 63.8% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-25 Gemini 2.5 Pro 63.8% جوجل تطرح نموذج التفكير جيمينى 2.5 برو
2025-03-25 Gemini 2.5 Pro 63.8% جوجل تقدم النموذج التجريبي Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI تطلق GPT-4.5، أكبر نموذج لها، لـ ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet يحقق 49% على SWE-bench Verified
2024-12-20 o3 71.7% OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
2024-12-20 o3 71.7% OpenAI تستعرض نموذج o3 للاستدلال مع إنجازات في ARC AGI و Frontier Math
2024-10-30 Claude 3.5 Sonnet 49.0% حقق Claude 3.5 Sonnet نتيجة بنسبة 49% على SWE-bench Verified مع الحد الأدنى من الهيكل المساعد
2024-10-22 Claude 3.5 Sonnet 49.0% أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"
2024-10-22 Claude 3.5 Haiku 40.6% أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI تطلق مجموعة SWE-bench Verified الفرعية المُتحقق منها من قبل البشر
2024-08-13 GPT‑4o 33.2% OpenAI تطلق مجموعة SWE-bench Verified الفرعية المُتحقق منها من قبل البشر