Бенчмарк · agentic

SWE-bench Verified

64 результатов 43 моделей

Проверяет, может ли ИИ-агент решать реальные GitHub-issue от начала до конца. Набор «Verified» — 500 задач, вручную проверенных на популярных open-source репозиториях Python.

Подробнее
Пример
По баг-репорту и репозиторию модель должна выдать патч кода — например, починить падающую функцию разбора дат, чтобы прошёл тест-сьют проекта.
Метрика
% решённых issue — обычно как pass@1 (одна попытка). Больше — лучше.
Приёмка
Полностью автоматически: патч применяется, и реальные скрытые юнит-тесты проекта запускаются в песочнице. Задача засчитывается, только если проходят все целевые тесты и ничего не ломается.
Почему важно
Ведущий бенчмарк реальных кодинг-агентов и заглавная цифра в каждом frontier-релизе; прогресс здесь показывает, насколько агенты близки к автономной разработке.
Разбор примера
Задача
Репозиторий django/django на фиксированном базовом коммите. Баг-репорт: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) возвращает '___this-is-a-test___', хотя ведущие и хвостовые подчёркивания и дефисы должны обрезаться, чтобы получилось 'this-is-a-test'. Модель получает только текст issue и репозиторий и должна выдать патч в формате unified diff.
Решение
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
Разбор
slugify схлопывает внутренние разделители, но никогда не обрезает окружающие -/_, поэтому добавление .strip("-_") к финальному re.sub их удаляет; патч минимален и не меняет остальное поведение. SWE-bench Verified применяет патч к репозиторию на базовом коммите и оценивает запуском скрытого набора тестов — проходит только если все тесты FAIL_TO_PASS становятся зелёными, а все PASS_TO_PASS остаются зелёными.
0 25 50 75 100 2024-08-13 2025-08-08 2026-08-03 GPT‑4o · 33.2 · 2024-08-13 Agentless · 32 · 2024-08-13 Claude 3.5 Haiku · 40.6 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT‑4.1 · 54.6 · 2025-04-14 GPT-4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 Kimi K2-Instruct · 65.8 · 2025-07-11 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LoopCoder-v2 · 64.4 · 2026-06-17 LoopCoder-V2 · 64.4 · 2026-06-17 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3-30B-A3B · 6 · 2026-07-14 Qwen3.5-35B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
GPT‑4o Agentless Claude 3.5 Haiku Claude 3.5 Sonnet o3 GPT-4.5 Gemini 2.5 Pro GPT‑4.1 GPT-4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2 Kimi K2-Instruct GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral Small 2 Devstral 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LoopCoder-v2 LoopCoder-V2 LLM-as-a-Verifier Qwen3-30B-A3B Qwen3.5-35B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
Хронология
Дата Модель Результат Источник
2026-08-03 Orchard-SWE 69.7% Microsoft Research выпускает фреймворк Orchard для масштабируемого агентного ИИ
2026-08-03 Inkling-Small 80.2% Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
2026-07-24 Claude Opus 5 96.0% Anthropic выпустила Claude Opus 5 с включённым по умолчанию режимом размышлений и улучшениями в агентном программировании
2026-07-19 DeepSeek V4 Pro 80.6% Сравнение Kimi K3, DeepSeek V4 Pro и GLM-5.2 по бенчмаркам, лицензии и стоимости обслуживания
2026-07-17 Devstral 2 72.2% Mistral Vibe for Code лидирует среди четырёх кодовых агентов в задаче от каркаса до PR
2026-07-17 Devstral Small 2 68.0% Mistral Vibe for Code лидирует среди четырёх кодовых агентов в задаче от каркаса до PR
2026-07-14 Qwen3-30B-A3B 6.0% UMoE переупорядочивает пулы экспертов MoE для улучшенного доменно-специфичного тонкого настройки
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE переупорядочивает пулы экспертов MoE для улучшенного доменно-специфичного тонкого настройки
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier представляет общую систему верификации с непрерывным оцениванием
2026-06-17 LoopCoder-V2 64.4% LoopCoder-V2: Модель PLT с двумя циклами достигает наилучшего соотношения выгоды и затрат
2026-06-17 LoopCoder-v2 64.4% LoopCoder-v2 достигает оптимальной производительности при двух циклах
2026-04-25 Qwen3.6-27B 77.2% Alibaba выпустила Qwen3.6-27B, превосходящую более крупного предшественника на бенчмарках по программированию
2026-04-24 V4-Pro-Max 80.6% DeepSeek выпустила V4 с эффективной архитектурой длинного контекста для агентов
2026-03-25 o3 71.7% OpenAI объявляет о выводе o3 из ChatGPT и публикует результаты бенчмарков
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic выпустила Claude Sonnet 4.6 с улучшенным программированием, управлением компьютером и контекстом на 1 млн токенов
2026-02-05 Claude Opus 4.6 80.8% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2026-02-01 Claude Opus 4.6 80.8% Очищенные бенчмарки выявляют разрыв в 12 пунктов между ведущими ИИ-моделями для кодинга
2026-02-01 MiniMax M2.5 80.2% Очищенные бенчмарки выявляют разрыв в 12 пунктов между ведущими ИИ-моделями для кодинга
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B и DeepSeek V4 Flash лидируют в локальных бенчмарках для программирования
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI представляет GPT-5.2 с передовыми возможностями для профессиональной интеллектуальной работы
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI выпустила GPT-5.2, превосходящую Gemini 3 в тестах по программированию и рассуждению
2025-12-09 Devstral Small 2 68.0% Mistral выпускает модели для разработки Devstral 2 и Mistral Vibe CLI
2025-12-09 Devstral 2 72.2% Mistral выпускает модели для разработки Devstral 2 и Mistral Vibe CLI
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI выпустила Kimi K2 Thinking с агентным использованием инструментов
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI делает GPT-5.1-Codex-Max моделью по умолчанию в Codex CLI
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI выпустила Kimi K2 Thinking, открытую модель рассуждений на 1 трлн параметров
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic выпустила Claude Sonnet 4.5 с улучшенными возможностями программирования и агентов
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI выпустила API GPT-5 с улучшениями для кодинга и агентов
2025-08-07 GPT-5 74.9% OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня
2025-08-07 GPT-5 74.9% OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой
2025-08-07 GPT-5 74.9% OpenAI запускает унифицированную GPT-5 с маршрутизацией в реальном времени и бесплатным доступом
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% Zhipu AI выпустила модели GLM-4.5, сопоставимые с Claude и DeepSeek
2025-07-28 Kimi K2 65.8% Moonshot выпустила Kimi K2, открытую агентную MoE-модель с 32B активных параметров
2025-07-28 Kimi K2 65.8% Kimi K2: открытая MoE-модель с 1T параметров и оптимизатором MuonClip
2025-07-11 Kimi K2 65.8% Moonshot AI выпустила Kimi K2: MoE-модель с 1 трлн параметров и агентными возможностями
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI выпустила Kimi-K2-Instruct, MoE-модель на 1 трлн параметров с агентными возможностями
2025-07-10 Devstral Medium 61.6% Mistral AI выпускает Devstral Small 1.1 и Devstral Medium вместе с All Hands AI
2025-07-10 Devstral Small 1.1 53.6% Mistral AI выпускает Devstral Small 1.1 и Devstral Medium вместе с All Hands AI
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-05-23 Claude Opus 4 72.5% Anthropic выпустила Claude Opus 4 и Sonnet 4 с гибридным рассуждением
2025-05-23 Claude Sonnet 4 72.7% Anthropic выпустила Claude Opus 4 и Sonnet 4 с гибридным рассуждением
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI выпустила агентную LLM Devstral для разработки программного обеспечения
2025-04-17 o4-mini 68.1% OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT‑4.1 54.6% OpenAI запустила GPT-4.1, GPT-4.1 mini и GPT-4.1 nano в API
2025-04-14 GPT-4.1 54.6% OpenAI выпустила семейство GPT-4.1 с контекстом на 1 млн токенов и улучшениями для программирования
2025-03-26 Gemini 2.5 Pro 63.8% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2025-03-25 Gemini 2.5 Pro 63.8% Google представляет модель мышления Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google представляет экспериментальную модель Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI выпустила GPT-4.5, свою самую большую модель, для ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet достигает 49% на SWE-bench Verified
2024-12-20 o3 71.7% OpenAI выпустила модель o3 с высокой производительностью в рассуждениях и программировании
2024-12-20 o3 71.7% OpenAI демонстрирует модель рассуждений o3 с прорывами в ARC AGI и Frontier Math
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet достигает 49% на SWE-bench Verified при минимальном агентном каркасе
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic обновляет Claude 3.5 Sonnet, выпускает Claude 3.5 Haiku и бета-версию функции «computer use»
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic обновляет Claude 3.5 Sonnet, выпускает Claude 3.5 Haiku и бета-версию функции «computer use»
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 GPT‑4o 33.2% OpenAI выпустила SWE-bench Verified с проверенной человеком выборкой
2024-08-13 Agentless 32.0% OpenAI выпустила SWE-bench Verified с проверенной человеком выборкой