Benchmark · agentic

DeepSWE

25 परिणाम 20 मॉडल

DataCurve's long-horizon real-repo coding-agent suite (headline metric = pass@1 resolve rate); Artificial Analysis swapped SWE-bench Pro out of its Coding Agent Index for it. Not a SWE-bench variant.

0 23.5 47 70.5 94 2026-07-27 2026-08-18 2026-09-10 Kimi K3 · 68.5 · 2026-07-27 GPT-5.6 Sol · 72.7 · 2026-07-27 GPT-5.6 Sol · 85.8 · 2026-08-18 Gemini 3.6 Flash · 49 · 2026-07-27 DeepSeek-V4-Flash · 54.4 · 2026-07-31 DeepSeek-V4-Flash-0731 · 54.4 · 2026-07-31 Qwen3.8-Max · 56.6 · 2026-08-03 DeepSeek-V4 Flash 0731 · 53.3 · 2026-08-07 GPT-5.6 Luna · 67.2 · 2026-08-07 Grok 4.6 · 65.9 · 2026-08-13 DeepSeek-V4-Pro · 62.7 · 2026-08-13 Gemini 3.7 Flash · 65.3 · 2026-08-13 GLM-5.3 · 66.9 · 2026-08-17 GLM-5.3 · 69 · 2026-08-22 DeepSeek V4 Pro 0813 · 88.5 · 2026-08-18 DeepSeek V4 Pro 0813 · 62.8 · 2026-08-18 Claude Fable 5 · 69.7 · 2026-08-18 Claude Fable 5 · 69.7 · 2026-08-22 Ornith-1.5 · 56 · 2026-08-19 Ornith-1.5 · 56 · 2026-08-20 DeepSeek-V4-Flash-Vision-Exp · 59.3 · 2026-08-21 GLM-5.3-Flash · 63 · 2026-08-26 Muse Spark 1.3 · 75.4 · 2026-09-04 GPT-6 Astra · 74.1 · 2026-09-04 DeepSeek-V4.1-Flash · 74.2 · 2026-09-10
Kimi K3 GPT-5.6 Sol Gemini 3.6 Flash DeepSeek-V4-Flash DeepSeek-V4-Flash-0731 Qwen3.8-Max DeepSeek-V4 Flash 0731 GPT-5.6 Luna Grok 4.6 DeepSeek-V4-Pro Gemini 3.7 Flash GLM-5.3 DeepSeek V4 Pro 0813 Claude Fable 5 Ornith-1.5 DeepSeek-V4-Flash-Vision-Exp GLM-5.3-Flash Muse Spark 1.3 GPT-6 Astra DeepSeek-V4.1-Flash
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-10 DeepSeek-V4.1-Flash 74.2% DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया
2026-09-04 GPT-6 Astra 74.1% OpenAI ने GPT-6 Astra जारी किया, जो 1.05M संदर्भ के साथ एक कंप्यूटर-उपयोग मॉडल है
2026-09-04 Muse Spark 1.3 75.4% Meta ने Muse Spark 1.3 जारी किया है जिसमें कम टूल कॉल और टोकन हैं
2026-08-26 GLM-5.3-Flash 63.0% Ox Alpha, GLM-5.3-Flash है
2026-08-22 GLM-5.3 69.0% GLM-5.3 DeepSWE पर Claude Fable 5 की सटीकता को पांचवें खर्च पर बराबर लाता है
2026-08-22 Claude Fable 5 69.7% GLM-5.3 DeepSWE पर Claude Fable 5 की सटीकता को पांचवें खर्च पर बराबर लाता है
2026-08-21 DeepSeek-V4-Flash-Vision-Exp 59.3% DeepSeek ने DeepSeek-V4-Flash-Vision-Exp मल्टीमोडल मॉडल जारी किया
2026-08-20 Ornith-1.5 56.0% Z.ai ने पोस्ट-ट्रेनिंग स्केलिंग नियम का प्रस्ताव रखा और GLM 5.3 जारी किया; Ornith-1.5 स्व-सुधार के साथ लॉन्च हुआ
2026-08-19 Ornith-1.5 56.0% Ornith-1.5 ने स्वयं-सुधार प्रशिक्षण के साथ 9B, 35B-A3B, और 397B मॉडल जारी किए
2026-08-18 DeepSeek V4 Pro 0813 62.8% DeepSWE पर DeepSeek V4 Pro 0813 बनाम Claude Fable 5: लागत, कोडिंग और रूटिंग
2026-08-18 Claude Fable 5 69.7% DeepSWE पर DeepSeek V4 Pro 0813 बनाम Claude Fable 5: लागत, कोडिंग और रूटिंग
2026-08-18 GPT-5.6 Sol 85.8% DeepSeek V4 Pro और GPT-5.6 Sol का cascade 83% DeepSWE कार्यों को $3.35 में हल करता है
2026-08-18 DeepSeek V4 Pro 0813 88.5% DeepSeek V4 Pro और GPT-5.6 Sol का cascade 83% DeepSWE कार्यों को $3.35 में हल करता है
2026-08-17 GLM-5.3 66.9% Z.ai ने GLM-5.3 कोडिंग मॉडल लॉन्च किया; Cursor SpaceXAI में शामिल हुआ
2026-08-13 Gemini 3.7 Flash 65.3% Google ने बेहतर कोडिंग और कम लागत के साथ Gemini 3.7 Flash पेश किया
2026-08-13 DeepSeek-V4-Pro 62.7% DeepSeek-V4-Pro GA रिलीज ने एजेंट क्षमताओं को बढ़ाया और Responses API समर्थन जोड़ा
2026-08-13 Grok 4.6 65.9% SpaceXAI ने 500K संदर्भ और बेहतर एजेंटिक तर्क के साथ Grok 4.6 जारी किया
2026-08-07 DeepSeek-V4 Flash 0731 53.3% DeepSeek-V4 Flash 0731 बनाम GPT-5.6 Luna: DeepSWE पर लागत और कोडिंग
2026-08-07 GPT-5.6 Luna 67.2% DeepSeek-V4 Flash 0731 बनाम GPT-5.6 Luna: DeepSWE पर लागत और कोडिंग
2026-08-03 Qwen3.8-Max 56.6% अलibaba ने 2.4T-पैरामीटर MoE मॉडल Qwen3.8-Max जारी किया
2026-07-31 DeepSeek-V4-Flash-0731 54.4% DeepSeek ने कम लागत में प्रमुख एजेंटिक सुधारों के साथ V4-Flash-0731 जारी किया
2026-07-31 DeepSeek-V4-Flash 54.4% DeepSeek ने एजेंट क्षमताओं में वृद्धि के साथ DeepSeek-V4-Flash को सार्वजनिक बीटा में जारी किया
2026-07-27 Gemini 3.6 Flash 49.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-27 Kimi K3 68.5% Kimi K3 ने DeepSWE pass@4 पर GPT-5.6 Sol को हराया और लागत 64% कम की
2026-07-27 GPT-5.6 Sol 72.7% Kimi K3 ने DeepSWE pass@4 पर GPT-5.6 Sol को हराया और लागत 64% कम की