Benchmark · agentic

SWE-rebench

12 نتائج 12 نماذج

SWE-rebench هو نسخة محدَّثة باستمرار من معيار البرمجة SWE-bench، يأخذ مهامه من issues حديثة على GitHub لتقليل احتمال أن يكون النموذج قد رآها أثناء التدريب. ويُبلّغ عن نسبة مهام هندسة البرمجيات التي يحلّها النموذج (% resolved).

اقرأ المزيد
مثال
تعطي المهمة النموذجية النموذجَ تقرير خطأ حقيقيًا أو طلب ميزة من مستودع على GitHub، وعليه أن يعدّل شيفرة المشروع لحل تلك المشكلة.
طريقة التقييم
المقياس هو % resolved: عدد المهام التي يصلحها النموذج مقسومًا على العدد الإجمالي للمهام، معبَّرًا عنه كنسبة مئوية.
التحقق
يُقبل الحل تلقائيًا عندما تنجح مجموعة اختبارات المستودع نفسها على الشيفرة بعد التصحيح — يجب أن يجعل الإصلاح الاختبارات الفاشلة تنجح دون كسر البقية.
لماذا يهم
لأن مهامه تُجدَّد من issues حديثة، فإنه يقدّم قياسًا أنظف لمهارة البرمجة الحقيقية، يصعب تضخيمه عن طريق حفظ بيانات معايير قديمة ومنشورة.
مثال محلول
المهمة
نسخة SWE-rebench مبنية من مستودع Python حقيقي على GitHub (‏python-slugify‏)، مثبَّتة على commit أساسي. المشكلة: تُرجِع slugify('Hello, World!') القيمة 'hello--world' — الفواصل المتتالية تُنتج شرطتين بدلاً من واحدة، بينما الـ slug المتوقَّع هو 'hello-world'. المطلوب تسليمه: رقعة git-diff على لقطة المستودع تجعل اختبار FAIL_TO_PASS ينجح مع إبقاء جميع اختبارات PASS_TO_PASS خضراء.
الحل
--- a/slugify/slugify.py
+++ b/slugify/slugify.py
@@ def slugify(text):
     text = re.sub(r"[^\w\s-]", "", text).strip().lower()
-    return re.sub(r"[\s]+", "-", text)
+    text = re.sub(r"[\s]+", "-", text)
+    return re.sub(r"-{2,}", "-", text)
الشرح
يقوم مُولِّد الـ slug بدمج المسافات إلى - لكنه لا يزيل الشرطات المكررة، فتتسرَّب عدة فواصل؛ وإضافة re.sub(r'-{2,}', '-', text) تُوحِّدها إلى - واحدة. يقيّم SWE-rebench بالتنفيذ: يطبّق الرقعة داخل حاوية المستودع ولا يعتبر النسخة محلولة إلا إذا نجح اختبار FAIL_TO_PASS الآن وظلّت جميع اختبارات PASS_TO_PASS ناجحة (لوحة الصدارة = نسبة المحلولة %).
0 15 30 45 60 2026-02-01 2026-04-19 2026-07-05 MiniMax M2.5 · 39.6 · 2026-02-01 Claude Opus 4.6 · 51.7 · 2026-02-01 Claude Opus 4.8 xhigh · 56.5 · 2026-07-05 GLM-5.2 · 51.1 · 2026-07-05 Gemini 3.5 Flash · 49.5 · 2026-07-05 MiniMax M3 · 45.6 · 2026-07-05 DeepSeek-V4 Pro · 42.7 · 2026-07-05 MiMo V2.5 Pro · 42.4 · 2026-07-05 DeepSeek-V4 Flash · 38.4 · 2026-07-05 Qwen3.6-27B · 36.5 · 2026-07-05 Qwen3.6-35B-A3B · 33.8 · 2026-07-05 Gemma 4 31B · 16.5 · 2026-07-05
MiniMax M2.5 Claude Opus 4.6 Claude Opus 4.8 xhigh GLM-5.2 Gemini 3.5 Flash MiniMax M3 DeepSeek-V4 Pro MiMo V2.5 Pro DeepSeek-V4 Flash Qwen3.6-27B Qwen3.6-35B-A3B Gemma 4 31B
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-05 Claude Opus 4.8 xhigh 56.5% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 GLM-5.2 51.1% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 Gemini 3.5 Flash 49.5% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 MiniMax M3 45.6% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 DeepSeek-V4 Pro 42.7% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 MiMo V2.5 Pro 42.4% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 DeepSeek-V4 Flash 38.4% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 Qwen3.6-27B 36.5% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 Qwen3.6-35B-A3B 33.8% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-07-05 Gemma 4 31B 16.5% قائمة SWE-rebench تضيف GLM-5.2 وQwen3.6 وGemma 4 وتحسن واجهة المستخدم
2026-02-01 MiniMax M2.5 39.6% تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة
2026-02-01 Claude Opus 4.6 51.7% تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة