あるユーザーが、公式のmini-swe-agentスケフォールドを使用して、Ox AlphaモデルをSWE-bench Verified-Miniデータセットでベンチマークし、96%の解決率(50タスク中48タスク)を達成した。評価は公式のSWE-bench Dockerハーネスでローカルで行われ、FAIL_TO_PASSとPASS_TO_PASSのテストがすべてパスした場合のみタスクが解決されたものと見なされる。
- モデル: opencodeのGoゲートウェイ経由で提供されるOx Alpha。
- スケフォールド: mini-swe-agent v2.4.6(Bash-Only公式リーダーボード用スケフォールド)。
- データセット: swe-bench-verified-mini。djangoとsphinxリポジトリのみを含む50タスクのサブセット。
- 結果: 48/50が解決され、失敗はdjango__django-11790およびdjango__django-11815で発生;タスクあたりの平均ステップ数は40。
- 比較: このスコアは、同じサブセットでClaude Fable 5の95%を上回っているが、著者はこれは暗記やより小さく簡単なデータセットのため膨張している可能性があると指摘している。
著者は、この結果が無料ティアモデルとしては不自然に高いと考えており、96%という数値は完全な500タスクセットでテストされたモデルとの比較可能なベンチマークではなく、上限として扱うよう助言している。