Бенчмарк · agentic

DeepSWE

25 результатов 20 моделей

DataCurve's long-horizon real-repo coding-agent suite (headline metric = pass@1 resolve rate); Artificial Analysis swapped SWE-bench Pro out of its Coding Agent Index for it. Not a SWE-bench variant.

0 23.5 47 70.5 94 2026-07-27 2026-08-18 2026-09-10 Kimi K3 · 68.5 · 2026-07-27 GPT-5.6 Sol · 72.7 · 2026-07-27 GPT-5.6 Sol · 85.8 · 2026-08-18 Gemini 3.6 Flash · 49 · 2026-07-27 DeepSeek-V4-Flash · 54.4 · 2026-07-31 DeepSeek-V4-Flash-0731 · 54.4 · 2026-07-31 Qwen3.8-Max · 56.6 · 2026-08-03 DeepSeek-V4 Flash 0731 · 53.3 · 2026-08-07 GPT-5.6 Luna · 67.2 · 2026-08-07 Grok 4.6 · 65.9 · 2026-08-13 DeepSeek-V4-Pro · 62.7 · 2026-08-13 Gemini 3.7 Flash · 65.3 · 2026-08-13 GLM-5.3 · 66.9 · 2026-08-17 GLM-5.3 · 69 · 2026-08-22 DeepSeek V4 Pro 0813 · 88.5 · 2026-08-18 DeepSeek V4 Pro 0813 · 62.8 · 2026-08-18 Claude Fable 5 · 69.7 · 2026-08-18 Claude Fable 5 · 69.7 · 2026-08-22 Ornith-1.5 · 56 · 2026-08-19 Ornith-1.5 · 56 · 2026-08-20 DeepSeek-V4-Flash-Vision-Exp · 59.3 · 2026-08-21 GLM-5.3-Flash · 63 · 2026-08-26 Muse Spark 1.3 · 75.4 · 2026-09-04 GPT-6 Astra · 74.1 · 2026-09-04 DeepSeek-V4.1-Flash · 74.2 · 2026-09-10
Kimi K3 GPT-5.6 Sol Gemini 3.6 Flash DeepSeek-V4-Flash DeepSeek-V4-Flash-0731 Qwen3.8-Max DeepSeek-V4 Flash 0731 GPT-5.6 Luna Grok 4.6 DeepSeek-V4-Pro Gemini 3.7 Flash GLM-5.3 DeepSeek V4 Pro 0813 Claude Fable 5 Ornith-1.5 DeepSeek-V4-Flash-Vision-Exp GLM-5.3-Flash Muse Spark 1.3 GPT-6 Astra DeepSeek-V4.1-Flash
Хронология
Дата Модель Результат Источник
2026-09-10 DeepSeek-V4.1-Flash 74.2% DeepSeek выпустила модель V4.1-Flash с нативной мультимодальной поддержкой
2026-09-04 GPT-6 Astra 74.1% OpenAI выпустила GPT-6 Astra — модель для работы с компьютером с контекстом 1.05M
2026-09-04 Muse Spark 1.3 75.4% Meta выпустила Muse Spark 1.3 с меньшим числом вызовов инструментов и токенов
2026-08-26 GLM-5.3-Flash 63.0% Ox Alpha — это GLM-5.3-Flash
2026-08-22 GLM-5.3 69.0% GLM-5.3 достигает точности Claude Fable 5 на DeepSWE при стоимости в пять раз ниже
2026-08-22 Claude Fable 5 69.7% GLM-5.3 достигает точности Claude Fable 5 на DeepSWE при стоимости в пять раз ниже
2026-08-21 DeepSeek-V4-Flash-Vision-Exp 59.3% DeepSeek выпустила мультимодальную модель DeepSeek-V4-Flash-Vision-Exp
2026-08-20 Ornith-1.5 56.0% Z.ai предлагает закон масштабирования после дообучения и выпускает GLM 5.3; Ornith-1.5 выходит с функцией самосовершенствования
2026-08-19 Ornith-1.5 56.0% Ornith-1.5 выпускает модели 9B, 35B-A3B и 397B с самосовершенствующимся обучением
2026-08-18 DeepSeek V4 Pro 0813 62.8% DeepSeek V4 Pro 0813 против Claude Fable 5 на DeepSWE: стоимость, программирование и маршрутизация
2026-08-18 Claude Fable 5 69.7% DeepSeek V4 Pro 0813 против Claude Fable 5 на DeepSWE: стоимость, программирование и маршрутизация
2026-08-18 GPT-5.6 Sol 85.8% DeepSeek V4 Pro и GPT-5.6 Sol: каскадное решение 83% задач DeepSWE за $3,35
2026-08-18 DeepSeek V4 Pro 0813 88.5% DeepSeek V4 Pro и GPT-5.6 Sol: каскадное решение 83% задач DeepSWE за $3,35
2026-08-17 GLM-5.3 66.9% Z.ai запускает модель для кодинга GLM-5.3; Cursor присоединяется к SpaceXAI
2026-08-13 Gemini 3.7 Flash 65.3% Google представляет Gemini 3.7 Flash с улучшенным программированием и сниженной стоимостью
2026-08-13 DeepSeek-V4-Pro 62.7% GA-релиз DeepSeek-V4-Pro улучшает возможности агентов и добавляет поддержку API ответов
2026-08-13 Grok 4.6 65.9% SpaceXAI выпускает Grok 4.6 с контекстом на 500K токенов и улучшенным агентным рассуждением
2026-08-07 DeepSeek-V4 Flash 0731 53.3% DeepSeek-V4 Flash 0731 против GPT-5.6 Luna на DeepSWE: стоимость и программирование
2026-08-07 GPT-5.6 Luna 67.2% DeepSeek-V4 Flash 0731 против GPT-5.6 Luna на DeepSWE: стоимость и программирование
2026-08-03 Qwen3.8-Max 56.6% Alibaba выпустила Qwen3.8-Max — MoE-модель с 2,4 трлн параметров
2026-07-31 DeepSeek-V4-Flash-0731 54.4% DeepSeek выпустила V4-Flash-0731 с существенными улучшениями агентных способностей при снижении стоимости
2026-07-31 DeepSeek-V4-Flash 54.4% DeepSeek выпускает DeepSeek-V4-Flash в публичную бета-версию с улучшенными возможностями агента
2026-07-27 Gemini 3.6 Flash 49.0% Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
2026-07-27 Kimi K3 68.5% Kimi K3 превосходит GPT-5.6 Sol на DeepSWE pass@4 и обходится на 64% дешевле
2026-07-27 GPT-5.6 Sol 72.7% Kimi K3 превосходит GPT-5.6 Sol на DeepSWE pass@4 и обходится на 64% дешевле