Para peneliti memperkenalkan OSReward, sebuah benchmark realistis yang dirancang untuk mengevaluasi keandalan model visi-bahasa (VLM) yang bertindak sebagai hakim untuk lintasan agen penggunaan komputer. Studi ini mengungkapkan bahwa bahkan VLM mutakhir pun mengalami bias kemurahan hati sistematis dan sering kali terlalu mahal untuk skala besar, sementara model terbuka yang terjangkau kinerjanya buruk.
- OSReward menampilkan beragam lintasan agen dengan putusan kebenaran dasar yang berasal dari anotasi manusia multi-tahap di berbagai platform.
- Benchmark ini mencakup OSReward-Hard untuk kasus menantang dan OSReward-Multi untuk penilaian efisiensi berbutir halus.
- Evaluasi menunjukkan bahwa hakim VLM saat ini salah mengklasifikasikan eksekusi gagal sebagai sukses, menciptakan kesenjangan antara keandalan dan biaya.
- Untuk mengatasi hal ini, para penulis merilis OS-Shepherd-100K, sebuah korpus terbuka dari putusan lintasan yang dianotasi dengan penalaran.
- Dilatih pada data ini, model OS-Shepherd terbuka (9B dan 35B) menyamai hakim komersial dengan biaya lebih rendah sebesar 30-60%.
Karya ini memberikan sinyal hadiah yang murah dan stabil bagi komunitas serta menawarkan analisis ekstensif untuk menginformasikan desain evaluasi penggunaan komputer yang andal.