Seorang pengguna melakukan benchmarking model Ox Alpha pada dataset SWE-bench Verified-Mini, mencapai tingkat resolusi 96% (48 dari 50 tugas) menggunakan kerangka kerja mini-swe-agent resmi. Evaluasi dilakukan secara lokal dengan harness Docker SWE-bench resmi, di mana sebuah tugas dianggap terselesaikan hanya jika semua tes FAIL_TO_PASS dan PASS_TO_PASS berhasil.

  • Model: Ox Alpha dilayani melalui gateway Go milik opencode.
  • Kerangka Kerja: mini-swe-agent v2.4.6 (kerangka kerja papan peringkat resmi Bash-Only).
  • Dataset: swe-bench-verified-mini, subset 50 tugas yang hanya berisi repositori django dan sphinx.
  • Hasil: 48/50 terselesaikan, dengan kegagalan pada django__django-11790 dan django__django-11815; rata-rata 40 langkah per tugas.
  • Perbandingan: Skor ini melampaui Claude Fable 5 yang mencapai 95% pada subset yang sama, meskipun penulis mencatat hal ini mungkin terinflasi karena hafalan atau dataset yang lebih kecil dan lebih mudah.

Penulis menganggap hasil tersebut terlalu tinggi untuk model tier gratis dan menyarankan agar angka 96% diperlakukan sebagai batas atas daripada benchmark yang dapat dibandingkan dengan model yang diuji pada set 500 tugas penuh.