Un usuario evaluó el modelo Ox Alpha en el conjunto de datos SWE-bench Verified-Mini, logrando una tasa de resolución del 96% (48 de cada 50 tareas) utilizando la estructura oficial mini-swe-agent. La evaluación se realizó localmente con el marco Docker oficial de SWE-bench, donde una tarea se considera resuelta solo si pasan todas las pruebas FAIL_TO_PASS y PASS_TO_PASS.

  • Modelo: Ox Alpha servido a través del gateway Go de opencode.
  • Estructura: mini-swe-agent v2.4.6 (estructura oficial del ranking solo para Bash).
  • Conjunto de datos: swe-bench-verified-mini, un subconjunto de 50 tareas que contiene únicamente repositorios de django y sphinx.
  • Resultados: 48/50 resueltas, con fallos en django__django-11790 y django__django-11815; promedio de 40 pasos por tarea.
  • Comparación: La puntuación supera el 95% de Claude Fable 5 en el mismo subconjunto, aunque el autor señala que esto podría estar inflado debido a la memorización o a un conjunto de datos más pequeño y fácil.

El autor considera que el resultado es sospechosamente alto para un modelo de nivel gratuito y aconseja tratar la cifra del 96% como un límite superior en lugar de una evaluación comparable frente a modelos probados en el conjunto completo de 500 tareas.