Пользователь протестировал модель Ox Alpha на наборе данных SWE-bench Verified-Mini, достигнув показателя разрешения в 96% (48 из 50 задач) с использованием официального каркаса mini-swe-agent. Оценка проводилась локально с помощью официального Docker-инструмента SWE-bench, где задача считается решённой только в том случае, если все тесты FAIL_TO_PASS и PASS_TO_PASS проходят успешно.
- Модель: Ox Alpha, запущенная через Go-шлюз opencode.
- Каркас: mini-swe-agent v2.4.6 (официальный каркас для лидерборда только с Bash).
- Набор данных: swe-bench-verified-mini, подмножество из 50 задач, содержащее только репозитории django и sphinx.
- Результаты: 48/50 решено, сбои в django__django-11790 и django__django-11815; в среднем 40 шагов на задачу.
- Сравнение: Результат превышает показатель Claude Fable 5 в 95% на том же подмножестве, хотя автор отмечает, что это может быть завышено из-за запоминания или меньшего и более простого набора данных.
Автор считает результат подозрительно высоким для модели бесплатного уровня и рекомендует рассматривать показатель 96% как верхнюю границу, а не как сопоставимый бенчмарк по сравнению с моделями, протестированными на полном наборе из 500 задач.