Benchmark · agentic

SWE-bench Multilingual

7 نتائج 5 نماذج

يقيس SWE-bench Multilingual ما إذا كان وكيل برمجة يعمل بالذكاء الاصطناعي قادرًا على حل مشكلات GitHub الحقيقية عبر تعديل مستودع شيفرة بعدة لغات برمجة. الدرجة هي % Resolved: نسبة المهام من أصل 300 التي يجتاز إصلاحها اختبارات المشروع نفسه.

اقرأ المزيد
مثال
نوع المهمة: يُعطى الوكيل تقرير خطأ من مستودع open-source حقيقي (مثل مشروع بلغة Go أو Java أو Ruby) مع قاعدة الشيفرة عند commit ما قبل الإصلاح، وعليه إنتاج patch يعدّل ملفًا أو أكثر لإزالة المشكلة الموصوفة — دون تقديم حل مرجعي.
طريقة التقييم
المقياس هو % Resolved: تُقيَّم كل حالة من الحالات الـ300 بنجاح/فشل، والدرجة هي نسبة الحالات الناجحة. لا تنجح الحالة إلا إذا نجحت، بعد تطبيق patch الوكيل، جميع اختبارات Fail-to-Pass (التي تستهدف الخطأ) وبقيت جميع اختبارات Pass-to-Pass (السلوك القائم) ناجحة.
التحقق
يُتحقَّق من patch بتشغيل مجموعة اختبارات المستودع داخل container معزول: يجب أن تنجح اختبارات Fail-to-Pass المحددة الآن وأن تبقى جميع اختبارات Pass-to-Pass ناجحة. أي فشل أو خطأ أو patch لا ينطبق يُعلِّم الحالة كغير محلولة؛ ولا توجد درجة جزئية.
لماذا يهم
يختبر قدرة البرمجة فيما وراء Python عبر 9 لغات و42 مستودعًا حقيقيًا، ويكشف أن النماذج تحل عددًا أقل بكثير من المشكلات في لغات مثل Go وRust وPHP مقارنةً بـPython — وهو اختبار أكثر صدقًا لقدرة التعميم في هندسة البرمجيات عبر اللغات.
مثال محلول
المهمة
حالة توضيحية تمثيلية. المستودع: مكتبة أدوات نصوص بلغة Go عند commit ما قبل الإصلاح. Issue: تسبب Reverse() في panic / تُرجع نصًا مشوَّهًا مع السلاسل التي تحوي محارف UTF-8 متعددة البايتات. يتوقع اختبار Fail-to-Pass المسمى TestReverseUnicode أن يكون Reverse("héllo") == "olléh". لا يتلقى الوكيل سوى نص الـissue والمستودع — دون patch مرجعي.
الحل
func Reverse(s string) string {
	r := []rune(s)
	for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
		r[i], r[j] = r[j], r[i]
	}
	return string(r)
}
الشرح
كانت الشيفرة الأصلية تعكس السلسلة بايتًا بايتًا، ما يقطع محارف UTF-8 متعددة البايتات ويُفسد محارف مثل é؛ أما التحويل إلى شريحة []rune وتبديل الطرفين فيعكس حسب نقطة ترميز Unicode، لذا يعطي Reverse("héllo") الناتج "olléh". التقييم: يُقبل فقط إذا نجح اختبار TestReverseUnicode (Fail-to-Pass) الآن وبقيت جميع اختبارات Pass-to-Pass ناجحة داخل الـcontainer.
0 21 42 63 84 2025-07-11 2026-01-15 2026-07-22 Kimi K2 · 47.3 · 2025-07-11 Kimi K2 · 47.3 · 2025-07-28 Kimi K2 · 47.3 · 2025-07-28 Kimi K2-Instruct · 47.3 · 2025-07-11 Kimi K2 Thinking · 61.1 · 2025-11-07 Composer 2 · 73.7 · 2026-03-27 Laguna S 2.1 · 78.5 · 2026-07-22
Kimi K2 Kimi K2-Instruct Kimi K2 Thinking Composer 2 Laguna S 2.1
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-22 Laguna S 2.1 78.5% بولسايد تطلق لاغونا إس 2.1، نموذج برمجة وكيلي بوزن مفتوح
2026-03-27 Composer 2 73.7% Cursor تنشر التقرير التقني حول تدريب نموذج البرمجة الوكيلية Composer 2
2025-11-07 Kimi K2 Thinking 61.1% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-07-28 Kimi K2 47.3% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-07-28 Kimi K2 47.3% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-07-11 Kimi K2 47.3% Moonshot AI تطلق Kimi K2، نموذج MoE بـ 1T معلمة مع قدرات وكيلية
2025-07-11 Kimi K2-Instruct 47.3% Moonshot AI تطلق Kimi-K2-Instruct، نموذج MoE بـ 1 تريليون معلمة مع قدرات وكيلة