Un utilisateur a évalué le modèle Ox Alpha sur l'ensemble de données SWE-bench Verified-Mini, atteignant un taux de résolution de 96 % (48 sur 50 tâches) en utilisant le squelette officiel mini-swe-agent. L'évaluation a été menée localement avec le harnais Docker officiel SWE-bench, où une tâche est considérée comme résolue uniquement si tous les tests FAIL_TO_PASS et PASS_TO_PASS réussissent.
- Modèle : Ox Alpha servi via la passerelle Go d'opencode.
- Squelette : mini-swe-agent v2.4.6 (squelette du classement officiel Bash-Only).
- Ensemble de données : swe-bench-verified-mini, un sous-ensemble de 50 tâches contenant uniquement les dépôts django et sphinx.
- Résultats : 48/50 résolues, avec des échecs sur django__django-11790 et django__django-11815 ; moyenne de 40 étapes par tâche.
- Comparaison : Le score dépasse les 95 % de Claude Fable 5 sur le même sous-ensemble, bien que l'auteur note que cela peut être gonflé en raison d'une mémorisation ou d'un ensemble de données plus petit et plus facile.
L'auteur considère ce résultat suspectement élevé pour un modèle de niveau gratuit et conseille de traiter le chiffre de 96 % comme une borne supérieure plutôt que comme un benchmark comparable contre des modèles testés sur l'ensemble complet de 500 tâches.