Benchmark · agentic

SWE-rebench

12 परिणाम 12 मॉडल

SWE-rebench, कोडिंग बेंचमार्क SWE-bench का लगातार अपडेट होता रहने वाला संस्करण है, जो हाल के GitHub issues से कार्य लेता है ताकि यह संभावना घटे कि मॉडल ने उन्हें प्रशिक्षण के दौरान पहले ही देख लिया हो। यह बताता है कि मॉडल कितने प्रतिशत सॉफ़्टवेयर-इंजीनियरिंग कार्य हल करता है (% resolved)।

और पढ़ें
उदाहरण
एक सामान्य कार्य में मॉडल को किसी GitHub रिपॉज़िटरी से एक असली बग रिपोर्ट या फ़ीचर अनुरोध दिया जाता है, और उसे उस समस्या को हल करने के लिए प्रोजेक्ट का कोड संपादित करना होता है।
स्कोरिंग
मीट्रिक % resolved है: मॉडल जितने कार्य ठीक करता है उनकी संख्या को कुल कार्यों की संख्या से भाग देकर प्रतिशत में व्यक्त किया जाता है।
सत्यापन
जब रिपॉज़िटरी का अपना टेस्ट सूट संशोधित कोड पर पास हो जाता है, तो समाधान अपने-आप स्वीकार हो जाता है — फ़िक्स को असफल हो रहे टेस्ट को हरा करना होता है, बिना बाकी को तोड़े।
यह क्यों मायने रखता है
चूँकि इसके कार्य हाल के issues से लगातार नए किए जाते हैं, यह असली कोडिंग कौशल का अधिक साफ़ आकलन देता है, जिसे पुराने सार्वजनिक बेंचमार्क डेटा को रटकर बढ़ाना कठिन है।
हल किया गया उदाहरण
कार्य
GitHub के एक असली Python रिपॉज़िटरी (python-slugify) से बनाया गया SWE-rebench इंस्टेंस, जो एक बेस commit पर पिन किया गया है। समस्या: slugify('Hello, World!') 'hello--world' लौटाता है — लगातार आने वाले separators एक के बजाय दोहरा hyphen देते हैं, जबकि अपेक्षित slug 'hello-world' है। देना है: रिपॉज़िटरी स्नैपशॉट के विरुद्ध एक git-diff patch जो FAIL_TO_PASS test को पास कराए और सभी PASS_TO_PASS tests को हरा बनाए रखे।
समाधान
--- a/slugify/slugify.py
+++ b/slugify/slugify.py
@@ def slugify(text):
     text = re.sub(r"[^\w\s-]", "", text).strip().lower()
-    return re.sub(r"[\s]+", "-", text)
+    text = re.sub(r"[\s]+", "-", text)
+    return re.sub(r"-{2,}", "-", text)
व्याख्या
slug बनाने वाला कोड whitespace को - में समेट देता है पर दोहराए गए hyphens को नहीं हटाता, इसलिए कई separators बाहर निकल आते हैं; re.sub(r'-{2,}', '-', text) जोड़ने से वे एक ही - में सामान्य हो जाते हैं। SWE-rebench निष्पादन के आधार पर आँकता है: patch को रिपॉज़िटरी कंटेनर में लगाया जाता है और इंस्टेंस तभी हल माना जाता है जब FAIL_TO_PASS test अब पास हो और सभी PASS_TO_PASS tests पहले जैसे पास रहें (leaderboard = हल किए गए %)।
0 15 30 45 60 2026-02-01 2026-04-19 2026-07-05 MiniMax M2.5 · 39.6 · 2026-02-01 Claude Opus 4.6 · 51.7 · 2026-02-01 Claude Opus 4.8 xhigh · 56.5 · 2026-07-05 GLM-5.2 · 51.1 · 2026-07-05 Gemini 3.5 Flash · 49.5 · 2026-07-05 MiniMax M3 · 45.6 · 2026-07-05 DeepSeek-V4 Pro · 42.7 · 2026-07-05 MiMo V2.5 Pro · 42.4 · 2026-07-05 DeepSeek-V4 Flash · 38.4 · 2026-07-05 Qwen3.6-27B · 36.5 · 2026-07-05 Qwen3.6-35B-A3B · 33.8 · 2026-07-05 Gemma 4 31B · 16.5 · 2026-07-05
MiniMax M2.5 Claude Opus 4.6 Claude Opus 4.8 xhigh GLM-5.2 Gemini 3.5 Flash MiniMax M3 DeepSeek-V4 Pro MiMo V2.5 Pro DeepSeek-V4 Flash Qwen3.6-27B Qwen3.6-35B-A3B Gemma 4 31B
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-05 Claude Opus 4.8 xhigh 56.5% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 GLM-5.2 51.1% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 Gemini 3.5 Flash 49.5% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 MiniMax M3 45.6% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 DeepSeek-V4 Pro 42.7% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 MiMo V2.5 Pro 42.4% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 DeepSeek-V4 Flash 38.4% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 Qwen3.6-27B 36.5% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 Qwen3.6-35B-A3B 33.8% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-07-05 Gemma 4 31B 16.5% SWE-rebench लीडरबोर्ड में GLM-5.2, Qwen3.6, Gemma 4 का जोड़ और UI में सुधार
2026-02-01 MiniMax M2.5 39.6% डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं
2026-02-01 Claude Opus 4.6 51.7% डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं