Un usuario evaluó el modelo Ox Alpha en el conjunto de datos SWE-bench Verified-Mini, logrando una tasa de resolución del 96% (48 de cada 50 tareas) utilizando la estructura oficial mini-swe-agent. La evaluación se realizó localmente con el marco Docker oficial de SWE-bench, donde una tarea se considera resuelta solo si pasan todas las pruebas FAIL_TO_PASS y PASS_TO_PASS.
- Modelo: Ox Alpha servido a través del gateway Go de opencode.
- Estructura: mini-swe-agent v2.4.6 (estructura oficial del ranking solo para Bash).
- Conjunto de datos: swe-bench-verified-mini, un subconjunto de 50 tareas que contiene únicamente repositorios de django y sphinx.
- Resultados: 48/50 resueltas, con fallos en django__django-11790 y django__django-11815; promedio de 40 pasos por tarea.
- Comparación: La puntuación supera el 95% de Claude Fable 5 en el mismo subconjunto, aunque el autor señala que esto podría estar inflado debido a la memorización o a un conjunto de datos más pequeño y fácil.
El autor considera que el resultado es sospechosamente alto para un modelo de nivel gratuito y aconseja tratar la cifra del 96% como un límite superior en lugar de una evaluación comparable frente a modelos probados en el conjunto completo de 500 tareas.