Benchmark · agentic

SWE-bench Verified

63 परिणाम 41 मॉडल

जाँचता है कि कोई AI एजेंट असली GitHub issues को शुरू से अंत तक हल कर सकता है या नहीं। "Verified" सेट लोकप्रिय ओपन-सोर्स Python रिपॉज़िटरी से लिए गए 500 मानव-सत्यापित कार्य हैं।

और पढ़ें
उदाहरण
एक बग रिपोर्ट और रिपॉज़िटरी दिए जाने पर, मॉडल को एक कोड patch तैयार करना होता है — जैसे किसी विफल हो रही date-parsing फ़ंक्शन को ठीक करना ताकि प्रोजेक्ट का test suite पास हो जाए।
स्कोरिंग
हल किए गए issues का % — आमतौर पर pass@1 (एक प्रयास) के रूप में रिपोर्ट किया जाता है। अधिक बेहतर है।
सत्यापन
पूरी तरह स्वचालित: तैयार किया गया patch लगाया जाता है और प्रोजेक्ट के असली छिपे हुए unit tests एक sandbox में चलाए जाते हैं। कोई कार्य तभी गिना जाता है जब हर लक्ष्य test पास हो और कुछ भी regress न हो।
यह क्यों मायने रखता है
असली दुनिया के coding-agent बेंचमार्क में अग्रणी और हर frontier रिलीज़ में एक प्रमुख आँकड़ा; यहाँ की प्रगति यह दर्शाती है कि एजेंट स्वायत्त सॉफ़्टवेयर इंजीनियरिंग के कितने करीब हैं।
हल किया गया उदाहरण
कार्य
फ़िक्स्ड बेस commit पर रिपॉज़िटरी django/django। बग रिपोर्ट: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) '___this-is-a-test___' लौटाता है, लेकिन आगे/पीछे लगे underscores और hyphens हट जाने चाहिए ताकि परिणाम 'this-is-a-test' हो। मॉडल को केवल issue का टेक्स्ट और रिपॉज़िटरी दिया जाता है और उसे एक unified-diff patch आउटपुट करना होता है।
समाधान
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
व्याख्या
slugify आंतरिक separators को समेट देता है लेकिन आसपास के -/_ को कभी नहीं काटता, इसलिए अंतिम re.sub में .strip("-_") जोड़ने से वे हट जाते हैं; patch न्यूनतम है और बाकी सारा व्यवहार बरकरार रखता है। SWE-bench Verified बेस commit पर रिपॉज़िटरी में patch लगाता है और छिपे हुए suite को चलाकर मूल्यांकन करता है — यह तभी पास होता है जब हर FAIL_TO_PASS test पास होने में बदल जाए और सभी PASS_TO_PASS tests हरे बने रहें।
0 25 50 75 100 2024-08-13 2025-08-11 2026-08-10 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-10 Qwen3.6-27B 77.2% मेटा ने म्यूज़ ग्लिमर जारी किया, एक 30B ओपन-वेइट्स एजेंटिक मॉडल जो एक उपभोक्ता GPU पर चलता है
2026-08-03 Orchard-SWE 69.7% माइक्रोसॉफ्ट रिसर्च ने स्केलेबल एजेंटिक एआई के लिए ऑर्किड फ्रेमवर्क जारी किया
2026-08-03 Inkling-Small 80.2% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-24 Claude Opus 5 96.0% Anthropic ने क्लॉड ओपस 5 को डिफ़ॉल्ट थिंकिंग और एजेंटिक कोडिंग लाभों के साथ जारी किया
2026-07-19 DeepSeek V4 Pro 80.6% बेंचमार्क, लाइसेंस और सर्विंग लागत पर Kimi K3, DeepSeek V4 Pro और GLM-5.2 की तुलना
2026-07-17 Devstral Small 2 68.0% कोड के लिए Mistral Vibe स्केफोल्ड-से-PR कार्य में चार कोडिंग एजेंट्स पर प्रथम स्थान हासिल करता है
2026-07-17 Devstral 2 72.2% कोड के लिए Mistral Vibe स्केफोल्ड-से-PR कार्य में चार कोडिंग एजेंट्स पर प्रथम स्थान हासिल करता है
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE सुधारित डोमेन-विशिष्ट फाइन-ट्यूनिंग के लिए MoE विशेषज्ञ पूल को पुनः संरेखित करता है
2026-07-14 Qwen3-30B-A3B 6.0% UMoE सुधारित डोमेन-विशिष्ट फाइन-ट्यूनिंग के लिए MoE विशेषज्ञ पूल को पुनः संरेखित करता है
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier ने निरंतर स्कोरिंग के साथ सामान्य उद्देश्य सत्यापन ढांचा पेश किया
2026-04-25 Qwen3.6-27B 77.2% अलिबाबा ने Qwen3.6-27B जारी किया, कोडिंग बेंचमार्क्स पर बड़े पूर्ववर्ती को हराया
2026-04-24 V4-Pro-Max 80.6% एजेंट्स के लिए कुशल लॉन्ग-कॉन्टेक्स्ट आर्किटेक्चर के साथ DeepSeek ने V4 जारी किया
2026-03-25 o3 71.7% OpenAI ने ChatGPT से o3 को निष्क्रिय करने की घोषणा की और बेंचमार्क स्कोर साझा किए
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic ने कोडिंग, कंप्यूटर उपयोग और 1M टोकन संदर्भ में सुधार के साथ Claude Sonnet 4.6 जारी किया
2026-02-05 Claude Opus 4.6 80.8% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2026-02-01 Claude Opus 4.6 80.8% डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं
2026-02-01 MiniMax M2.5 80.2% डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B और DeepSeek V4 Flash स्थानीय कोडिंग बेंचमार्क्स में अग्रणी
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI ने पेश किया GPT-5.2 जो पेशेवर ज्ञान कार्य के लिए अत्याधुनिक क्षमताओं से सुसज्जित है
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
2025-12-09 Devstral 2 72.2% Mistral ने Devstral 2 कोडिंग मॉडल और Mistral Vibe CLI जारी किए
2025-12-09 Devstral Small 2 68.0% Mistral ने Devstral 2 कोडिंग मॉडल और Mistral Vibe CLI जारी किए
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI ने Codex CLI में GPT-5.1-Codex-Max को डिफ़ॉल्ट बना दिया
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI ने एजेंटिक टूल उपयोग के साथ Kimi K2 Thinking जारी किया
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI ने कोडिंग और एजेंटिक सुधारों के साथ GPT-5 API जारी किया
2025-08-07 GPT-5 74.9% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-08-07 GPT-5 74.9% OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
2025-08-07 GPT-5 74.9% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
2025-07-28 Kimi K2 65.8% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-28 Kimi K2 65.8% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI ने Kimi-K2-Instruct जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है
2025-07-11 Kimi K2 65.8% Moonshot AI ने Kimi K2 जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है
2025-07-10 Devstral Medium 61.6% Mistral AI ने All Hands AI के साथ Devstral Small 1.1 और Devstral Medium जारी किए
2025-07-10 Devstral Small 1.1 53.6% Mistral AI ने All Hands AI के साथ Devstral Small 1.1 और Devstral Medium जारी किए
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-23 Claude Opus 4 72.5% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-23 Claude Sonnet 4 72.7% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI ने सॉफ्टवेयर इंजीनियरिंग के लिए Devstral एजेंटिक LLM जारी किया
2025-04-17 o4-mini 68.1% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI ने GPT-4.1 परिवार को 1M टोकन संदर्भ और कोडिंग सुधारों के साथ जारी किया
2025-04-14 GPT‑4.1 54.6% OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
2025-03-26 Gemini 2.5 Pro 63.8% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro 63.8% गूगल ने गेमिनी 2.5 प्रो थिंकिंग मॉडल पेश किया
2025-03-25 Gemini 2.5 Pro 63.8% Google ने Gemini 2.5 Pro प्रयोगात्मक मॉडल का परिचय दिया
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet ने SWE-bench Verified पर 49% हासिल किया
2024-12-20 o3 71.7% OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-12-20 o3 71.7% OpenAI ने ARC AGI और Frontier Math में सफलता के साथ o3 तर्क मॉडल का प्रीव्यू दिया
2024-10-30 Claude 3.5 Sonnet 49.0% न्यूनतम एजेंट सॉफ़्टवेयर के साथ क्लॉड 3.5 सोनेट ने SWE-bench Verified पर 49% हासिल किया
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI ने SWE-bench Verified जारी किया, जिसमें मानव-सत्यापित उपसमुच्चय शामिल है
2024-08-13 GPT‑4o 33.2% OpenAI ने SWE-bench Verified जारी किया, जिसमें मानव-सत्यापित उपसमुच्चय शामिल है