Benchmark · agentic
SWE-bench Multilingual
يقيس SWE-bench Multilingual ما إذا كان وكيل برمجة يعمل بالذكاء الاصطناعي قادرًا على حل مشكلات GitHub الحقيقية عبر تعديل مستودع شيفرة بعدة لغات برمجة. الدرجة هي % Resolved: نسبة المهام من أصل 300 التي يجتاز إصلاحها اختبارات المشروع نفسه.
اقرأ المزيد
- مثال
- نوع المهمة: يُعطى الوكيل تقرير خطأ من مستودع open-source حقيقي (مثل مشروع بلغة Go أو Java أو Ruby) مع قاعدة الشيفرة عند commit ما قبل الإصلاح، وعليه إنتاج patch يعدّل ملفًا أو أكثر لإزالة المشكلة الموصوفة — دون تقديم حل مرجعي.
- طريقة التقييم
- المقياس هو % Resolved: تُقيَّم كل حالة من الحالات الـ300 بنجاح/فشل، والدرجة هي نسبة الحالات الناجحة. لا تنجح الحالة إلا إذا نجحت، بعد تطبيق patch الوكيل، جميع اختبارات Fail-to-Pass (التي تستهدف الخطأ) وبقيت جميع اختبارات Pass-to-Pass (السلوك القائم) ناجحة.
- التحقق
- يُتحقَّق من patch بتشغيل مجموعة اختبارات المستودع داخل container معزول: يجب أن تنجح اختبارات Fail-to-Pass المحددة الآن وأن تبقى جميع اختبارات Pass-to-Pass ناجحة. أي فشل أو خطأ أو patch لا ينطبق يُعلِّم الحالة كغير محلولة؛ ولا توجد درجة جزئية.
- لماذا يهم
- يختبر قدرة البرمجة فيما وراء Python عبر 9 لغات و42 مستودعًا حقيقيًا، ويكشف أن النماذج تحل عددًا أقل بكثير من المشكلات في لغات مثل Go وRust وPHP مقارنةً بـPython — وهو اختبار أكثر صدقًا لقدرة التعميم في هندسة البرمجيات عبر اللغات.
مثال محلول
المهمة
حالة توضيحية تمثيلية. المستودع: مكتبة أدوات نصوص بلغة Go عند commit ما قبل الإصلاح. Issue: تسبب
Reverse() في panic / تُرجع نصًا مشوَّهًا مع السلاسل التي تحوي محارف UTF-8 متعددة البايتات. يتوقع اختبار Fail-to-Pass المسمى TestReverseUnicode أن يكون Reverse("héllo") == "olléh". لا يتلقى الوكيل سوى نص الـissue والمستودع — دون patch مرجعي.الحل
func Reverse(s string) string {
r := []rune(s)
for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
r[i], r[j] = r[j], r[i]
}
return string(r)
}
الشرح
كانت الشيفرة الأصلية تعكس السلسلة بايتًا بايتًا، ما يقطع محارف UTF-8 متعددة البايتات ويُفسد محارف مثل
é؛ أما التحويل إلى شريحة []rune وتبديل الطرفين فيعكس حسب نقطة ترميز Unicode، لذا يعطي Reverse("héllo") الناتج "olléh". التقييم: يُقبل فقط إذا نجح اختبار TestReverseUnicode (Fail-to-Pass) الآن وبقيت جميع اختبارات Pass-to-Pass ناجحة داخل الـcontainer.| التاريخ | النموذج | النتيجة | المصدر |
|---|---|---|---|
| 2026-07-22 | Laguna S 2.1 | 78.5% | بولسايد تطلق لاغونا إس 2.1، نموذج برمجة وكيلي بوزن مفتوح |
| 2026-03-27 | Composer 2 | 73.7% | Cursor تنشر التقرير التقني حول تدريب نموذج البرمجة الوكيلية Composer 2 |
| 2025-11-07 | Kimi K2 Thinking | 61.1% | Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة |
| 2025-07-28 | Kimi K2 | 47.3% | مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة |
| 2025-07-28 | Kimi K2 | 47.3% | كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip |
| 2025-07-11 | Kimi K2 | 47.3% | Moonshot AI تطلق Kimi K2، نموذج MoE بـ 1T معلمة مع قدرات وكيلية |
| 2025-07-11 | Kimi K2-Instruct | 47.3% | Moonshot AI تطلق Kimi-K2-Instruct، نموذج MoE بـ 1 تريليون معلمة مع قدرات وكيلة |