Benchmark · agentic

SWE-bench Multilingual

7 परिणाम 5 मॉडल

SWE-bench Multilingual यह मापता है कि कोई AI कोडिंग एजेंट कई प्रोग्रामिंग भाषाओं के कोड रिपॉज़िटरी में बदलाव करके असली GitHub issue हल कर सकता है या नहीं। स्कोर % Resolved है: 300 कार्यों में से वह अनुपात जिनका फिक्स प्रोजेक्ट के अपने टेस्ट पास कर लेता है।

और पढ़ें
उदाहरण
कार्य का प्रकार: एजेंट को किसी असली open-source रिपॉज़िटरी (जैसे Go, Java या Ruby प्रोजेक्ट) की एक बग रिपोर्ट और फिक्स-से-पहले वाले commit पर कोडबेस दिया जाता है, और उसे एक patch बनाना होता है जो एक या अधिक फाइलों में बदलाव करके बताई गई समस्या को दूर करे — कोई संदर्भ हल नहीं दिया जाता।
स्कोरिंग
मीट्रिक % Resolved है: 300 में से हर instance को पास/फेल आँका जाता है और स्कोर पास हुए प्रतिशत के बराबर होता है। कोई instance तभी पास होता है जब एजेंट का patch लगाने के बाद बग को लक्षित करने वाले सभी Fail-to-Pass टेस्ट पास हों और सभी Pass-to-Pass टेस्ट (मौजूदा व्यवहार) अब भी पास होते रहें।
सत्यापन
patch को एक अलग-थलग container में रिपॉज़िटरी का टेस्ट सूट चलाकर जाँचा जाता है: निर्दिष्ट Fail-to-Pass टेस्ट अब पास होने चाहिए और सभी Pass-to-Pass टेस्ट पास होते रहने चाहिए। कोई भी विफलता, त्रुटि या न लगने वाला patch instance को अनसुलझा चिह्नित कर देता है; आंशिक अंक नहीं।
यह क्यों मायने रखता है
यह Python से आगे 9 भाषाओं और 42 असली रिपॉज़िटरी पर कोडिंग क्षमता परखता है और उजागर करता है कि मॉडल Go, Rust या PHP जैसी भाषाओं में Python की तुलना में काफी कम issue हल करते हैं — यह क्रॉस-भाषा सॉफ़्टवेयर इंजीनियरिंग सामान्यीकरण की अधिक ईमानदार परख है।
हल किया गया उदाहरण
कार्य
उदाहरणात्मक प्रतिनिधि instance। रिपॉज़िटरी: फिक्स-से-पहले वाले commit पर एक Go स्ट्रिंग-यूटिलिटी लाइब्रेरी। Issue: Reverse() बहु-बाइट UTF-8 वर्णों वाली स्ट्रिंग पर panic करता है / गड़बड़ टेक्स्ट लौटाता है। Fail-to-Pass टेस्ट TestReverseUnicode अपेक्षा करता है कि Reverse("héllo") == "olléh"। एजेंट को केवल issue का टेक्स्ट और रिपॉज़िटरी मिलते हैं — कोई संदर्भ patch नहीं।
समाधान
func Reverse(s string) string {
	r := []rune(s)
	for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
		r[i], r[j] = r[j], r[i]
	}
	return string(r)
}
व्याख्या
मूल कोड स्ट्रिंग को बाइट-दर-बाइट उलटता था, जिससे बहु-बाइट UTF-8 rune टूट जाते हैं और é जैसे वर्ण बिगड़ जाते हैं; []rune slice में बदलकर दोनों सिरे अदल-बदल करने से Unicode code point के हिसाब से उलटाव होता है, इसलिए Reverse("héllo") से "olléh" मिलता है। ग्रेडिंग: तभी स्वीकार जब TestReverseUnicode (Fail-to-Pass) अब पास हो और container में सभी Pass-to-Pass टेस्ट भी पास होते रहें।
0 21 42 63 84 2025-07-11 2026-01-15 2026-07-22 Kimi K2 · 47.3 · 2025-07-11 Kimi K2 · 47.3 · 2025-07-28 Kimi K2 · 47.3 · 2025-07-28 Kimi K2-Instruct · 47.3 · 2025-07-11 Kimi K2 Thinking · 61.1 · 2025-11-07 Composer 2 · 73.7 · 2026-03-27 Laguna S 2.1 · 78.5 · 2026-07-22
Kimi K2 Kimi K2-Instruct Kimi K2 Thinking Composer 2 Laguna S 2.1
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-22 Laguna S 2.1 78.5% Poolside ने Laguna S 2.1 जारी किया, एक ओपन-वेट एजेंटिक कोडिंग मॉडल
2026-03-27 Composer 2 73.7% Cursor ने एजेंटिक कोडिंग मॉडल ट्रेनिंग पर Composer 2 तकनीकी रिपोर्ट जारी की
2025-11-07 Kimi K2 Thinking 61.1% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-07-28 Kimi K2 47.3% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-07-28 Kimi K2 47.3% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-11 Kimi K2 47.3% Moonshot AI ने Kimi K2 जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है
2025-07-11 Kimi K2-Instruct 47.3% Moonshot AI ने Kimi-K2-Instruct जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है