Бенчмарк · agentic

SWE-rebench

12 результатов 12 моделей

SWE-rebench — постоянно обновляемый вариант бенчмарка кодинга SWE-bench, который берёт задачи из свежих issue на GitHub, чтобы снизить вероятность того, что модель уже видела их при обучении. Он показывает долю решённых инженерных задач (% resolved).

Подробнее
Пример
Типичная задача даёт модели реальный баг-репорт или запрос функции из репозитория на GitHub, и она должна отредактировать код проекта, чтобы устранить проблему.
Метрика
Метрика — % resolved: число задач, которые модель решила, делённое на общее число задач и выраженное в процентах.
Приёмка
Решение принимается автоматически, когда собственный набор тестов репозитория проходит на исправленном коде — фикс должен сделать падавшие тесты зелёными, не сломав остальные.
Почему важно
Поскольку задачи обновляются из свежих issue, бенчмарк даёт более честную оценку реального навыка программирования, которую труднее завысить, заучив старые публичные данные бенчмарков.
Разбор примера
Задача
Экземпляр SWE-rebench на основе реального Python-репозитория с GitHub (python-slugify), зафиксированного на базовом коммите. Проблема: slugify('Hello, World!') возвращает 'hello--world' — идущие подряд разделители дают удвоенный дефис вместо одного, хотя ожидаемый slug — 'hello-world'. Нужно предоставить git-diff патч к снимку репозитория, который делает тест FAIL_TO_PASS проходящим, а все тесты PASS_TO_PASS оставляет зелёными.
Решение
--- a/slugify/slugify.py
+++ b/slugify/slugify.py
@@ def slugify(text):
     text = re.sub(r"[^\w\s-]", "", text).strip().lower()
-    return re.sub(r"[\s]+", "-", text)
+    text = re.sub(r"[\s]+", "-", text)
+    return re.sub(r"-{2,}", "-", text)
Разбор
Построитель slug сворачивает пробелы в -, но не убирает повторяющиеся дефисы, поэтому несколько разделителей просачиваются; добавление re.sub(r'-{2,}', '-', text) нормализует их до одного -. SWE-rebench оценивает исполнением: патч применяется в контейнере репозитория, и экземпляр считается решённым, только если тест FAIL_TO_PASS теперь проходит, а все тесты PASS_TO_PASS по-прежнему проходят (лидерборд = % решённых).
0 15 30 45 60 2026-02-01 2026-04-19 2026-07-05 MiniMax M2.5 · 39.6 · 2026-02-01 Claude Opus 4.6 · 51.7 · 2026-02-01 Claude Opus 4.8 xhigh · 56.5 · 2026-07-05 GLM-5.2 · 51.1 · 2026-07-05 Gemini 3.5 Flash · 49.5 · 2026-07-05 MiniMax M3 · 45.6 · 2026-07-05 DeepSeek-V4 Pro · 42.7 · 2026-07-05 MiMo V2.5 Pro · 42.4 · 2026-07-05 DeepSeek-V4 Flash · 38.4 · 2026-07-05 Qwen3.6-27B · 36.5 · 2026-07-05 Qwen3.6-35B-A3B · 33.8 · 2026-07-05 Gemma 4 31B · 16.5 · 2026-07-05
MiniMax M2.5 Claude Opus 4.6 Claude Opus 4.8 xhigh GLM-5.2 Gemini 3.5 Flash MiniMax M3 DeepSeek-V4 Pro MiMo V2.5 Pro DeepSeek-V4 Flash Qwen3.6-27B Qwen3.6-35B-A3B Gemma 4 31B
Хронология
Дата Модель Результат Источник
2026-07-05 Claude Opus 4.8 xhigh 56.5% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 GLM-5.2 51.1% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 Gemini 3.5 Flash 49.5% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 MiniMax M3 45.6% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 DeepSeek-V4 Pro 42.7% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 MiMo V2.5 Pro 42.4% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 DeepSeek-V4 Flash 38.4% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 Qwen3.6-27B 36.5% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 Qwen3.6-35B-A3B 33.8% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-07-05 Gemma 4 31B 16.5% В рейтинг SWE-rebench добавлены GLM-5.2, Qwen3.6, Gemma 4 и улучшен интерфейс
2026-02-01 MiniMax M2.5 39.6% Очищенные бенчмарки выявляют разрыв в 12 пунктов между ведущими ИИ-моделями для кодинга
2026-02-01 Claude Opus 4.6 51.7% Очищенные бенчмарки выявляют разрыв в 12 пунктов между ведущими ИИ-моделями для кодинга