Benchmark · agentic
OSWorld
OSWorld adalah benchmark yang menguji agen pengguna komputer pada tugas-tugas nyata sistem operasi desktop yang mencakup aplikasi sehari-hari (pengelola berkas, peramban web, suite perkantoran). Benchmark ini melaporkan persentase tugas yang berhasil diselesaikan agen.
Selengkapnya
- Contoh
- Sebuah tugas dapat meminta agen membuka lembar kerja, mengubah suatu nilai atau memformat ulang data dan menyimpan berkas, atau menemukan berkas di pengelola berkas dan mengubah pengaturan sistem, dengan mengoperasikan antarmuka grafis (GUI) nyata seperti yang dilakukan manusia.
- Penilaian
- Metriknya adalah tingkat keberhasilan tugas (task success rate), yang dinyatakan dalam persen. Setiap tugas berhasil atau gagal, dan skornya adalah proporsi tugas yang lulus di seluruh kumpulan tugas.
- Verifikasi
- Hasil diperiksa secara otomatis oleh skrip berbasis eksekusi yang memeriksa keadaan akhir mesin (misalnya, apakah berkas, nilai, atau pengaturan yang benar kini ada), bukan dengan mencocokkan teks atau pemungutan suara manusia.
- Mengapa penting
- Benchmark ini mengukur apakah agen AI benar-benar dapat mengoperasikan komputer nyata di berbagai aplikasi — ujian otonomi yang jauh lebih sulit dan realistis daripada menjawab pertanyaan atau tugas satu aplikasi.
Contoh penyelesaian
Tugas
Sebuah GNOME Terminal terbuka di desktop Ubuntu. Di folder ~/project, cari secara rekursif semua file .log yang lebih besar dari 10 MB lalu hapus, dengan membiarkan semua file lain tetap utuh.
Solusi
find ~/project -type f -name '*.log' -size +10M -delete
Penjelasan
find menelusuri ~/project secara rekursif, memilih file biasa bernama *.log yang lebih besar dari 10 MB, dan -delete menghapus tepat file-file itu tanpa menyentuh yang lain. OSWorld menilai dengan pemeriksa khusus per tugas atas kondisi akhir sistem file mesin virtual (VM), dan memberi reward 1 hanya jika logs target hilang dan file lain tetap ada.