Benchmark · agentic

SWE-bench Verified

86 परिणाम 59 मॉडल

जाँचता है कि कोई AI एजेंट असली GitHub issues को शुरू से अंत तक हल कर सकता है या नहीं। "Verified" सेट लोकप्रिय ओपन-सोर्स Python रिपॉज़िटरी से लिए गए 500 मानव-सत्यापित कार्य हैं।

और पढ़ें
उदाहरण
एक बग रिपोर्ट और रिपॉज़िटरी दिए जाने पर, मॉडल को एक कोड patch तैयार करना होता है — जैसे किसी विफल हो रही date-parsing फ़ंक्शन को ठीक करना ताकि प्रोजेक्ट का test suite पास हो जाए।
स्कोरिंग
हल किए गए issues का % — आमतौर पर pass@1 (एक प्रयास) के रूप में रिपोर्ट किया जाता है। अधिक बेहतर है।
सत्यापन
पूरी तरह स्वचालित: तैयार किया गया patch लगाया जाता है और प्रोजेक्ट के असली छिपे हुए unit tests एक sandbox में चलाए जाते हैं। कोई कार्य तभी गिना जाता है जब हर लक्ष्य test पास हो और कुछ भी regress न हो।
यह क्यों मायने रखता है
असली दुनिया के coding-agent बेंचमार्क में अग्रणी और हर frontier रिलीज़ में एक प्रमुख आँकड़ा; यहाँ की प्रगति यह दर्शाती है कि एजेंट स्वायत्त सॉफ़्टवेयर इंजीनियरिंग के कितने करीब हैं।
हल किया गया उदाहरण
कार्य
फ़िक्स्ड बेस commit पर रिपॉज़िटरी django/django। बग रिपोर्ट: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) '___this-is-a-test___' लौटाता है, लेकिन आगे/पीछे लगे underscores और hyphens हट जाने चाहिए ताकि परिणाम 'this-is-a-test' हो। मॉडल को केवल issue का टेक्स्ट और रिपॉज़िटरी दिया जाता है और उसे एक unified-diff patch आउटपुट करना होता है।
समाधान
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
व्याख्या
slugify आंतरिक separators को समेट देता है लेकिन आसपास के -/_ को कभी नहीं काटता, इसलिए अंतिम re.sub में .strip("-_") जोड़ने से वे हट जाते हैं; patch न्यूनतम है और बाकी सारा व्यवहार बरकरार रखता है। SWE-bench Verified बेस commit पर रिपॉज़िटरी में patch लगाता है और छिपे हुए suite को चलाकर मूल्यांकन करता है — यह तभी पास होता है जब हर FAIL_TO_PASS test पास होने में बदल जाए और सभी PASS_TO_PASS tests हरे बने रहें।
0 25 50 75 100 2024-08-13 2025-09-05 2026-09-29 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Sonnet 4 · 72.7 · 2025-05-23 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT‑5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Qwen3.5-27B · 74.8 · 2026-08-18 Ornith-1.5 · 86 · 2026-08-19 Ornith-1.5 · 86 · 2026-08-20 Qwen3.5-9B · 14.6 · 2026-08-20 Qwen3.5-9B · 16.6 · 2026-09-02 Granite 4.2 30B · 57 · 2026-08-26 Granite 4.2 8B · 47.7 · 2026-08-26 K2-Horizon-7B · 70.6 · 2026-09-07 K2-Horizon-3.7B · 68.6 · 2026-09-07 Qwen Test agent (post-trained) + Repair agent (post-trained) · 72.6 · 2026-09-09 Qwen Test agent (post-trained) · 62.2 · 2026-09-09 Qwen Test agent (post-trained) · 62.2 · 2026-09-09 GPT-5.6-sol (Test agent) · 65.3 · 2026-09-09 GPT-5.6-sol (Test agent) · 65.3 · 2026-09-09 base Repair agent (no-test baseline) · 61.2 · 2026-09-09 base Repair agent (no-test baseline) · 61.2 · 2026-09-09 base Test agent · 57.3 · 2026-09-09 Qwen Test agent + Repair agent (post-trained) · 72.6 · 2026-09-09 base Test agent (no-test baseline) · 57.3 · 2026-09-09 Ember-1 · 92.2 · 2026-09-28 Qwen3.5-4B (with ROFT) · 49.2 · 2026-09-29 Qwen3.8-Flash-Next Coder · 75.6 · 2026-09-29 Gemini 3.5 Flash · 79 · 2026-09-29 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT-5 GPT‑5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Qwen3.5-27B Ornith-1.5 Qwen3.5-9B Granite 4.2 30B Granite 4.2 8B K2-Horizon-7B K2-Horizon-3.7B Qwen Test agent (post-trained) + Repair agent (post-trained) Qwen Test agent (post-trained) GPT-5.6-sol (Test agent) base Repair agent (no-test baseline) base Test agent Qwen Test agent + Repair agent (post-trained) base Test agent (no-test baseline) Ember-1 Qwen3.5-4B (with ROFT) Qwen3.8-Flash-Next Coder Gemini 3.5 Flash Claude 3.7 Sonnet OpenAI o3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-29 Gemini 3.5 Flash 79.0% AI एजेंट हार्नेस ओवरफिटिंग को रोकने के लिए Google Research ने RRSI जारी किया
2026-09-29 Qwen3.8-Flash-Next Coder 75.6% ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए
2026-09-29 Qwen3.5-4B (with ROFT) 49.2% ROFT स्व-उत्पन्न व्याख्याओं पर फाइन-ट्यून करके एजेंटिक मॉडलों को बेहतर बनाता है
2026-09-28 Ember-1 92.2% Fireworks AI ने Ember-1 जारी किया, जो 40% कम टोकन का उपयोग करने वाला Kimi K3 पर पोस्ट-ट्रेनिंग किया गया मॉडल है
2026-09-09 Qwen Test agent + Repair agent (post-trained) 72.6% ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
2026-09-09 Qwen Test agent (post-trained) 62.2% ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
2026-09-09 GPT-5.6-sol (Test agent) 65.3% ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
2026-09-09 base Test agent (no-test baseline) 57.3% ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
2026-09-09 base Repair agent (no-test baseline) 61.2% ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
2026-09-09 Qwen Test agent (post-trained) + Repair agent (post-trained) 72.6% ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
2026-09-09 Qwen Test agent (post-trained) 62.2% ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
2026-09-09 GPT-5.6-sol (Test agent) 65.3% ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
2026-09-09 base Repair agent (no-test baseline) 61.2% ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
2026-09-09 base Test agent 57.3% ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
2026-09-07 K2-Horizon-7B 70.6% IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
2026-09-07 K2-Horizon-3.7B 68.6% IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
2026-09-02 Qwen3.5-9B 16.6% CANOPY के साथ Qwen3-14B ने outcome-only RL का उपयोग करके AppWorld में शीर्ष स्थान हासिल किया
2026-08-26 Granite 4.2 30B 57.0% IBM ने खुले उद्योग मॉडलों के लिए स्वदेशी तर्क और एजेंटिक RL के साथ Granite 4.2 जारी किया
2026-08-26 Granite 4.2 8B 47.67% IBM ने खुले उद्योग मॉडलों के लिए स्वदेशी तर्क और एजेंटिक RL के साथ Granite 4.2 जारी किया
2026-08-20 Qwen3.5-9B 14.6% मेटा ने म्यूज़ वीडियो को नेटिव ऑडियो के साथ रिलीज़ किया; स्ट्राइप ने ओपनरूटर को अधिग्रहित किया
2026-08-20 Ornith-1.5 86.0% Z.ai ने पोस्ट-ट्रेनिंग स्केलिंग नियम का प्रस्ताव रखा और GLM 5.3 जारी किया; Ornith-1.5 स्व-सुधार के साथ लॉन्च हुआ
2026-08-19 Ornith-1.5 86.0% Ornith-1.5 ने स्वयं-सुधार प्रशिक्षण के साथ 9B, 35B-A3B, और 397B मॉडल जारी किए
2026-08-18 Qwen3.5-27B 74.8% Kozuchi Agent ने Qwen3.5-27B का उपयोग करके 374 SWE-bench Verified उदाहरणों को हल किया
2026-08-10 Qwen3.6-27B 77.2% मेटा ने म्यूज़ ग्लिमर जारी किया, एक 30B ओपन-वेइट्स एजेंटिक मॉडल जो एक उपभोक्ता GPU पर चलता है
2026-08-03 Orchard-SWE 69.7% माइक्रोसॉफ्ट रिसर्च ने स्केलेबल एजेंटिक एआई के लिए ऑर्किड फ्रेमवर्क जारी किया
2026-08-03 Inkling-Small 80.2% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-24 Claude Opus 5 96.0% Anthropic ने क्लॉड ओपस 5 को डिफ़ॉल्ट थिंकिंग और एजेंटिक कोडिंग लाभों के साथ जारी किया
2026-07-19 DeepSeek V4 Pro 80.6% बेंचमार्क, लाइसेंस और सर्विंग लागत पर Kimi K3, DeepSeek V4 Pro और GLM-5.2 की तुलना
2026-07-17 Devstral 2 72.2% कोड के लिए Mistral Vibe स्केफोल्ड-से-PR कार्य में चार कोडिंग एजेंट्स पर प्रथम स्थान हासिल करता है
2026-07-17 Devstral Small 2 68.0% कोड के लिए Mistral Vibe स्केफोल्ड-से-PR कार्य में चार कोडिंग एजेंट्स पर प्रथम स्थान हासिल करता है
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE सुधारित डोमेन-विशिष्ट फाइन-ट्यूनिंग के लिए MoE विशेषज्ञ पूल को पुनः संरेखित करता है
2026-07-14 Qwen3-30B-A3B 6.0% UMoE सुधारित डोमेन-विशिष्ट फाइन-ट्यूनिंग के लिए MoE विशेषज्ञ पूल को पुनः संरेखित करता है
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier ने निरंतर स्कोरिंग के साथ सामान्य उद्देश्य सत्यापन ढांचा पेश किया
2026-04-25 Qwen3.6-27B 77.2% अलिबाबा ने Qwen3.6-27B जारी किया, कोडिंग बेंचमार्क्स पर बड़े पूर्ववर्ती को हराया
2026-04-24 V4-Pro-Max 80.6% एजेंट्स के लिए कुशल लॉन्ग-कॉन्टेक्स्ट आर्किटेक्चर के साथ DeepSeek ने V4 जारी किया
2026-03-25 o3 71.7% OpenAI ने ChatGPT से o3 को निष्क्रिय करने की घोषणा की और बेंचमार्क स्कोर साझा किए
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic ने कोडिंग, कंप्यूटर उपयोग और 1M टोकन संदर्भ में सुधार के साथ Claude Sonnet 4.6 जारी किया
2026-02-05 Claude Opus 4.6 80.8% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2026-02-01 Claude Opus 4.6 80.8% डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं
2026-02-01 MiniMax M2.5 80.2% डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B और DeepSeek V4 Flash स्थानीय कोडिंग बेंचमार्क्स में अग्रणी
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI ने पेश किया GPT-5.2 जो पेशेवर ज्ञान कार्य के लिए अत्याधुनिक क्षमताओं से सुसज्जित है
2025-12-09 Devstral 2 72.2% Mistral ने Devstral 2 कोडिंग मॉडल और Mistral Vibe CLI जारी किए
2025-12-09 Devstral Small 2 68.0% Mistral ने Devstral 2 कोडिंग मॉडल और Mistral Vibe CLI जारी किए
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI ने Codex CLI में GPT-5.1-Codex-Max को डिफ़ॉल्ट बना दिया
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI ने एजेंटिक टूल उपयोग के साथ Kimi K2 Thinking जारी किया
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT-5 74.9% OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
2025-08-07 GPT‑5 74.9% OpenAI ने कोडिंग और एजेंटिक सुधारों के साथ GPT-5 API जारी किया
2025-08-07 GPT-5 74.9% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 74.9% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
2025-07-28 Kimi K2 65.8% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-07-28 Kimi K2 65.8% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI ने Kimi-K2-Instruct जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है
2025-07-11 Kimi K2 65.8% Moonshot AI ने Kimi K2 जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है
2025-07-10 Devstral Medium 61.6% Mistral AI ने All Hands AI के साथ Devstral Small 1.1 और Devstral Medium जारी किए
2025-07-10 Devstral Small 1.1 53.6% Mistral AI ने All Hands AI के साथ Devstral Small 1.1 और Devstral Medium जारी किए
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-23 Claude Sonnet 4 72.7% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-23 Claude Opus 4 72.5% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI ने सॉफ्टवेयर इंजीनियरिंग के लिए Devstral एजेंटिक LLM जारी किया
2025-04-17 o4-mini 68.1% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI ने GPT-4.1 परिवार को 1M टोकन संदर्भ और कोडिंग सुधारों के साथ जारी किया
2025-04-14 GPT‑4.1 54.6% OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
2025-03-26 Gemini 2.5 Pro 63.8% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro 63.8% Google ने Gemini 2.5 Pro प्रयोगात्मक मॉडल का परिचय दिया
2025-03-25 Gemini 2.5 Pro 63.8% गूगल ने गेमिनी 2.5 प्रो थिंकिंग मॉडल पेश किया
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet ने SWE-bench Verified पर 49% हासिल किया
2024-12-20 o3 71.7% OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-12-20 o3 71.7% OpenAI ने ARC AGI और Frontier Math में सफलता के साथ o3 तर्क मॉडल का प्रीव्यू दिया
2024-10-30 Claude 3.5 Sonnet 49.0% न्यूनतम एजेंट सॉफ़्टवेयर के साथ क्लॉड 3.5 सोनेट ने SWE-bench Verified पर 49% हासिल किया
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI ने SWE-bench Verified जारी किया, जिसमें मानव-सत्यापित उपसमुच्चय शामिल है
2024-08-13 GPT‑4o 33.2% OpenAI ने SWE-bench Verified जारी किया, जिसमें मानव-सत्यापित उपसमुच्चय शामिल है