Para peneliti memperkenalkan Mid-Harness, sebuah metode yang melakukan sampling dan verifikasi kandidat aksi pada batas model-harness untuk meningkatkan keandalan eksekusi pada agen terminal. Pendekatan ini mengalokasikan komputasi saat pengujian dengan memverifikasi beberapa opsi sebelum meneruskan satu untuk dieksekusi, menjaga generator dan harness tetap tidak berubah.

  • Pada TerminalBench-Lite, menggunakan verifier GPT-5.6 Sol dengan 8 aksi yang disampling meningkatkan Pass@1 dari 50,00% menjadi 68,03% dibandingkan agen dasar.
  • Ketika TMAX-9B berperan sebagai verifier, verifikasi berpasangan menghasilkan hasil terbaik di antara mekanisme yang dievaluasi.
  • Mendistilasi respons dari verifier yang lebih kuat ke dalam TMAX-9B进一步 meningkatkan Pass@1 tanpa mengubah generator aksi.
  • Menggabungkan penskalaan aksi dan trajektori dengan TMAX-9B mencapai tingkat keberhasilan lebih tinggi pada biaya token estimasi yang lebih rendah dibandingkan hanya menghasilkan lebih banyak trajektori.

Temuan ini mengidentifikasi penskalaan aksi sebagai target yang menjanjikan untuk penskalaan komputasi saat pengujian pada agen terminal, meningkatkan kinerja di berbagai model, benchmark, dan harness tambahan.