Um usuário avaliou o modelo Ox Alpha no conjunto de dados SWE-bench Verified-Mini, alcançando uma taxa de resolução de 96% (48 de 50 tarefas) usando o scaffold oficial mini-swe-agent. A avaliação foi realizada localmente com a estrutura Docker oficial do SWE-bench, onde uma tarefa é considerada resolvida apenas se todos os testes FAIL_TO_PASS e PASS_TO_PASS forem aprovados.
- Modelo: Ox Alpha servido através do gateway Go do opencode.
- Scaffold: mini-swe-agent v2.4.6 (scaffold do leaderboard oficial apenas para Bash).
- Conjunto de dados: swe-bench-verified-mini, um subconjunto de 50 tarefas contendo apenas repositórios django e sphinx.
- Resultados: 48/50 resolvidos, com falhas em django__django-11790 e django__django-11815; média de 40 etapas por tarefa.
- Comparação: A pontuação supera os 95% do Claude Fable 5 no mesmo subconjunto, embora o autor observe que isso pode ser inflacionado devido à memorização ou a um conjunto de dados menor e mais fácil.
O autor considera o resultado suspeitamente alto para um modelo de nível gratuito e aconselha tratar a figura de 96% como um limite superior em vez de uma benchmark comparável contra modelos testados no conjunto completo de 500 tarefas.