Бенчмарк · agentic

SWE-bench

9 результатов 7 моделей

SWE-bench проверяет, способна ли ИИ-система исправлять настоящие ошибки в программах: он берёт 2294 реальных задачи (issues) из популярных открытых Python-репозиториев на GitHub и просит модель сгенерировать патч с исправлением кода. Главная метрика — процент решённых задач.

Подробнее
Пример
Типичный пример даёт модели реальный баг-репорт или запрос функции из Python-проекта — скажем, задачу из Django или scikit-learn — вместе с кодом этого репозитория и просит сгенерировать патч, который устраняет проблему.
Метрика
Оценка — это процент решённых задач из 2294: задача засчитывается, только если патч модели после применения проходит собственный набор тестов репозитория.
Приёмка
Проверка полностью автоматическая: сгенерированный патч применяется к репозиторию и запускаются реальные тесты проекта; задача считается решённой, только если целевые падавшие тесты начинают проходить, а ранее проходившие остаются зелёными — без участия человека и без точного совпадения.
Почему важно
Он измеряет сквозные навыки разработки на реальном коде, а не на игрушечных задачах, поэтому за ним внимательно следят как за индикатором прогресса кодинг-агентов; для заголовочных цифр его в основном вытеснил проверенный людьми поднабор SWE-bench Verified.
Разбор примера
Задача
Репозиторий psf/requests. Пользователь сообщает, что установка заголовка запроса в None (чтобы удалить заголовок сессии по умолчанию) не даёт эффекта: ключ со значением None остаётся в объединённых заголовках вместо удаления. Дан репозиторий на коммите с багом и это issue — подготовьте patch, чтобы requests.sessions.merge_setting удалял ключи со значением None.
Решение
--- a/requests/sessions.py
+++ b/requests/sessions.py
@@ -412,6 +412,11 @@ def merge_setting(request_setting, session_setting, dict_class=OrderedDict):
     merged_setting = dict_class(to_key_val_list(session_setting))
     merged_setting.update(to_key_val_list(request_setting))
 
+    # Remove keys that are set to None. Extract the keys first to avoid
+    # mutating the dictionary while iterating over it.
+    none_keys = [k for (k, v) in merged_setting.items() if v is None]
+    for key in none_keys:
+        del merged_setting[key]
+
     return merged_setting
Разбор
После объединения словарей сессии и запроса любой ключ со значением None появился из явного переопределения на уровне запроса, призванного удалить значение по умолчанию, поэтому исправление собирает такие ключи и удаляет их (сначала формируя список, чтобы не менять словарь во время итерации). SWE-bench оценивает, применяя patch и запуская тесты FAIL_TO_PASS и PASS_TO_PASS этого экземпляра — задача решена, только если проходят все.
0 21.5 43 64.5 86 2023-10-10 2024-11-01 2025-11-25 Claude 2 · 2.0 · 2023-10-10 Claude 3.7 Sonnet · 70.3 · 2025-02-24 Claude Sonnet 4 · 72.7 · 2025-05-22 Claude Sonnet 4 · 72.7 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-22 Grok 4 Code · 75 · 2025-07-10 Qwen3-Coder-480B-A35B-Instruct · 55.4 · 2025-10-17 Claude Opus 4.5 · 80.9 · 2025-11-25
Claude 2 Claude 3.7 Sonnet Claude Sonnet 4 Claude Opus 4 Grok 4 Code Qwen3-Coder-480B-A35B-Instruct Claude Opus 4.5
Хронология
Дата Модель Результат Источник
2025-11-25 Claude Opus 4.5 80.9% Anthropic выпустила Claude Opus 4.5 с передовыми возможностями программирования и управления компьютером
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 55.4% Alibaba выпустила Qwen3-Coder-480B-A35B-Instruct, модель для программирования с открытым исходным кодом, сопоставимую по производительности с проприетарными решениями
2025-07-10 Grok 4 Code 75.0% xAI выпустила Grok 4 с тяжёлым многоагентным тарифом и доступом к данным в реальном времени
2025-05-22 Claude Sonnet 4 72.7% Anthropic выпустила Claude Opus 4 и Sonnet 4 с мерами безопасности ASL-3
2025-05-22 Claude Opus 4 72.5% Anthropic выпустила Claude Opus 4 и Sonnet 4 с мерами безопасности ASL-3
2025-05-22 Claude Opus 4 72.5% Anthropic представляет Claude Opus 4 и Sonnet 4 с расширенным мышлением и использованием инструментов
2025-05-22 Claude Sonnet 4 72.7% Anthropic представляет Claude Opus 4 и Sonnet 4 с расширенным мышлением и использованием инструментов
2025-02-24 Claude 3.7 Sonnet 70.3% Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
2023-10-10 Claude 2 1.96% SWE-bench представляет фреймворк для оценки языковых моделей на реальных проблемах GitHub