Benchmark · agentic

SWE-bench

9 परिणाम 7 मॉडल

SWE-bench यह जाँचता है कि कोई AI सिस्टम असली सॉफ़्टवेयर बग ठीक कर सकता है या नहीं: यह GitHub पर लोकप्रिय ओपन-सोर्स Python रिपॉज़िटरी से 2,294 असली issues लेता है और मॉडल से कोड ठीक करने वाला patch बनवाता है। मुख्य मीट्रिक हल किए गए issues का प्रतिशत है।

और पढ़ें
उदाहरण
एक सामान्य आइटम मॉडल को किसी Python प्रोजेक्ट पर दर्ज असली बग रिपोर्ट या फ़ीचर अनुरोध — जैसे Django या scikit-learn का कोई issue — उस रिपॉज़िटरी के कोड के साथ देता है, और उससे समस्या हल करने वाला patch बनाने को कहता है।
स्कोरिंग
स्कोर 2,294 issues में से हल किए गए का प्रतिशत है: कोई issue तभी गिना जाता है जब मॉडल का patch लागू करने पर रिपॉज़िटरी का अपना टेस्ट सूट पास हो जाए।
सत्यापन
सत्यापन पूरी तरह स्वचालित है: बनाया गया patch रिपॉज़िटरी पर लागू किया जाता है और प्रोजेक्ट के असली टेस्ट चलाए जाते हैं; टास्क तभी हल माना जाता है जब लक्षित फ़ेल होते टेस्ट पास होने लगें और पहले से पास टेस्ट पास बने रहें — कोई मानवीय निर्णय या सटीक-मिलान नहीं।
यह क्यों मायने रखता है
यह खिलौना अभ्यासों के बजाय असली कोड पर सिरे-से-सिरे तक की सॉफ़्टवेयर इंजीनियरिंग क्षमता मापता है, इसलिए इसे कोडिंग एजेंट्स की प्रगति के एक अहम संकेतक के रूप में बारीकी से देखा जाता है; सुर्खियों के आँकड़ों के लिए इसकी जगह काफ़ी हद तक मानव-सत्यापित उपसमूह SWE-bench Verified ने ले ली है।
हल किया गया उदाहरण
कार्य
रिपॉज़िटरी psf/requests। एक उपयोगकर्ता की रिपोर्ट है कि किसी request हेडर को None पर सेट करने (session के डिफ़ॉल्ट हेडर को हटाने के लिए) का कोई असर नहीं होता: None मान वाली key हटने के बजाय merge किए गए हेडरों में बनी रहती है। बग वाले commit पर मौजूद रिपॉज़िटरी और यह issue दिए जाने पर, एक patch बनाइए ताकि requests.sessions.merge_setting उन keys को हटा दे जिनका मान None है।
समाधान
--- a/requests/sessions.py
+++ b/requests/sessions.py
@@ -412,6 +412,11 @@ def merge_setting(request_setting, session_setting, dict_class=OrderedDict):
     merged_setting = dict_class(to_key_val_list(session_setting))
     merged_setting.update(to_key_val_list(request_setting))
 
+    # Remove keys that are set to None. Extract the keys first to avoid
+    # mutating the dictionary while iterating over it.
+    none_keys = [k for (k, v) in merged_setting.items() if v is None]
+    for key in none_keys:
+        del merged_setting[key]
+
     return merged_setting
व्याख्या
session और request के dictionary को merge करने के बाद, None की ओर इशारा करने वाली कोई भी key request-स्तर के एक स्पष्ट override से आई है जिसका उद्देश्य किसी डिफ़ॉल्ट मान को मिटाना है, इसलिए फ़िक्स ऐसी keys को इकट्ठा करके हटा देता है (iteration के दौरान dictionary बदलने से बचने के लिए पहले सूची बना लेता है)। SWE-bench, patch लगाकर और उस instance के FAIL_TO_PASS तथा PASS_TO_PASS tests चलाकर मूल्यांकन करता है — तभी हल माना जाता है जब सभी पास हों।
0 21.5 43 64.5 86 2023-10-10 2024-11-01 2025-11-25 Claude 2 · 2.0 · 2023-10-10 Claude 3.7 Sonnet · 70.3 · 2025-02-24 Claude Sonnet 4 · 72.7 · 2025-05-22 Claude Sonnet 4 · 72.7 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-22 Grok 4 Code · 75 · 2025-07-10 Qwen3-Coder-480B-A35B-Instruct · 55.4 · 2025-10-17 Claude Opus 4.5 · 80.9 · 2025-11-25
Claude 2 Claude 3.7 Sonnet Claude Sonnet 4 Claude Opus 4 Grok 4 Code Qwen3-Coder-480B-A35B-Instruct Claude Opus 4.5
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2025-11-25 Claude Opus 4.5 80.9% Anthropic ने कोडिंग और कंप्यूटर उपयोग में अत्याधुनिक क्षमताओं के साथ Claude Opus 4.5 जारी किया
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 55.4% अलibaba ने Qwen3-Coder-480B-A35B-Instruct जारी किया, एक ओपन-सोर्स कोडिंग मॉडल जो प्रोप्राइटरी प्रदर्शन के बराबर है
2025-07-10 Grok 4 Code 75.0% xAI ने Grok 4 को भारी बहु-एजेंट स्तर और लाइव वेब डेटा के साथ जारी किया
2025-05-22 Claude Sonnet 4 72.7% Anthropic ने Claude Opus 4 और Sonnet 4 को ASL-3 सुरक्षा उपायों के साथ जारी किया
2025-05-22 Claude Opus 4 72.5% Anthropic ने Claude Opus 4 और Sonnet 4 को ASL-3 सुरक्षा उपायों के साथ जारी किया
2025-05-22 Claude Opus 4 72.5% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
2025-05-22 Claude Sonnet 4 72.7% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
2025-02-24 Claude 3.7 Sonnet 70.3% Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
2023-10-10 Claude 2 1.96% SWE-bench ने वास्तविक GitHub मुद्दों पर LM का मूल्यांकन करने के लिए फ्रेमवर्क पेश किया