Benchmark · agentic
SWE-bench Multilingual
SWE-bench Multilingual यह मापता है कि कोई AI कोडिंग एजेंट कई प्रोग्रामिंग भाषाओं के कोड रिपॉज़िटरी में बदलाव करके असली GitHub issue हल कर सकता है या नहीं। स्कोर % Resolved है: 300 कार्यों में से वह अनुपात जिनका फिक्स प्रोजेक्ट के अपने टेस्ट पास कर लेता है।
और पढ़ें
- उदाहरण
- कार्य का प्रकार: एजेंट को किसी असली open-source रिपॉज़िटरी (जैसे Go, Java या Ruby प्रोजेक्ट) की एक बग रिपोर्ट और फिक्स-से-पहले वाले commit पर कोडबेस दिया जाता है, और उसे एक patch बनाना होता है जो एक या अधिक फाइलों में बदलाव करके बताई गई समस्या को दूर करे — कोई संदर्भ हल नहीं दिया जाता।
- स्कोरिंग
- मीट्रिक % Resolved है: 300 में से हर instance को पास/फेल आँका जाता है और स्कोर पास हुए प्रतिशत के बराबर होता है। कोई instance तभी पास होता है जब एजेंट का patch लगाने के बाद बग को लक्षित करने वाले सभी Fail-to-Pass टेस्ट पास हों और सभी Pass-to-Pass टेस्ट (मौजूदा व्यवहार) अब भी पास होते रहें।
- सत्यापन
- patch को एक अलग-थलग container में रिपॉज़िटरी का टेस्ट सूट चलाकर जाँचा जाता है: निर्दिष्ट Fail-to-Pass टेस्ट अब पास होने चाहिए और सभी Pass-to-Pass टेस्ट पास होते रहने चाहिए। कोई भी विफलता, त्रुटि या न लगने वाला patch instance को अनसुलझा चिह्नित कर देता है; आंशिक अंक नहीं।
- यह क्यों मायने रखता है
- यह Python से आगे 9 भाषाओं और 42 असली रिपॉज़िटरी पर कोडिंग क्षमता परखता है और उजागर करता है कि मॉडल Go, Rust या PHP जैसी भाषाओं में Python की तुलना में काफी कम issue हल करते हैं — यह क्रॉस-भाषा सॉफ़्टवेयर इंजीनियरिंग सामान्यीकरण की अधिक ईमानदार परख है।
हल किया गया उदाहरण
कार्य
उदाहरणात्मक प्रतिनिधि instance। रिपॉज़िटरी: फिक्स-से-पहले वाले commit पर एक Go स्ट्रिंग-यूटिलिटी लाइब्रेरी। Issue:
Reverse() बहु-बाइट UTF-8 वर्णों वाली स्ट्रिंग पर panic करता है / गड़बड़ टेक्स्ट लौटाता है। Fail-to-Pass टेस्ट TestReverseUnicode अपेक्षा करता है कि Reverse("héllo") == "olléh"। एजेंट को केवल issue का टेक्स्ट और रिपॉज़िटरी मिलते हैं — कोई संदर्भ patch नहीं।समाधान
func Reverse(s string) string {
r := []rune(s)
for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
r[i], r[j] = r[j], r[i]
}
return string(r)
}
व्याख्या
मूल कोड स्ट्रिंग को बाइट-दर-बाइट उलटता था, जिससे बहु-बाइट UTF-8 rune टूट जाते हैं और
é जैसे वर्ण बिगड़ जाते हैं; []rune slice में बदलकर दोनों सिरे अदल-बदल करने से Unicode code point के हिसाब से उलटाव होता है, इसलिए Reverse("héllo") से "olléh" मिलता है। ग्रेडिंग: तभी स्वीकार जब TestReverseUnicode (Fail-to-Pass) अब पास हो और container में सभी Pass-to-Pass टेस्ट भी पास होते रहें।| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2026-07-22 | Laguna S 2.1 | 78.5% | Poolside ने Laguna S 2.1 जारी किया, एक ओपन-वेट एजेंटिक कोडिंग मॉडल |
| 2026-03-27 | Composer 2 | 73.7% | Cursor ने एजेंटिक कोडिंग मॉडल ट्रेनिंग पर Composer 2 तकनीकी रिपोर्ट जारी की |
| 2025-11-07 | Kimi K2 Thinking | 61.1% | Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल |
| 2025-07-28 | Kimi K2 | 47.3% | Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है |
| 2025-07-28 | Kimi K2 | 47.3% | Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल |
| 2025-07-11 | Kimi K2 | 47.3% | Moonshot AI ने Kimi K2 जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है |
| 2025-07-11 | Kimi K2-Instruct | 47.3% | Moonshot AI ने Kimi-K2-Instruct जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है |