한 사용자가 Ox Alpha 모델을 SWE-bench Verified-Mini 데이터셋에서 벤치마킹했으며, 공식 mini-swe-agent 스캐폴드를 사용하여 96%의 해결률(50개 작업 중 48개)을 달성했습니다. 평가는 공식 SWE-bench Docker 하니스를 통해 로컬로 수행되었으며, FAIL_TO_PASS 및 PASS_TO_PASS 테스트가 모두 통과할 경우에만 작업이 해결된 것으로 간주됩니다.
- 모델: opencode의 Go 게이트웨이를 통해 서빙된 Ox Alpha.
- 스캐폴드: mini-swe-agent v2.4.6 (Bash 전용 공식 리더보드 스캐폴드).
- 데이터셋: swe-bench-verified-mini, django 및 sphinx 저장소만 포함하는 50개 작업 부분 집합.
- 결과: 48/50 해결, django__django-11790 및 django__django-11815에서 실패; 작업당 평균 40단계.
- 비교: 이 점수는 동일한 부분 집합에서 Claude Fable 5의 95%를 상회하지만, 저자는 이것이 암기나 더 작고 쉬운 데이터셋으로 인해 과대평가되었을 수 있다고 언급합니다.
저자는 이 결과가 무료 티어 모델로서는 의심스러울 정도로 높다고 생각하며, 96%라는 수치를 전체 500개 작업 집합에서 테스트된 모델들과 비교할 수 있는 벤치마크가 아닌 상한선으로 간주할 것을 권고합니다.