Benchmark · agentic

AgentBench

0 hasil 0 model

AgentBench mengevaluasi LLM sebagai agen interaktif di 8 lingkungan berbeda (tugas kode, permainan, dan web), mengukur pengambilan keputusan multi-giliran; setiap lingkungan menghasilkan skornya sendiri yang digabung menjadi satu Overall Score berbobot.

Selengkapnya
Contoh
Tugas lingkungan «Sistem operasi»: agen diberi tujuan dalam bahasa alami (misalnya menghitung berkas yang memenuhi suatu syarat atau mengubah izin sebuah berkas), lalu ia mengetikkan perintah bash giliran demi giliran, membaca setiap keluaran, kemudian mengirim jawaban akhir atau meninggalkan shell dalam keadaan yang diminta.
Penilaian
Setiap lingkungan memakai metriknya sendiri — tingkat keberhasilan (OS, DB, House-Holding), F1 (graf pengetahuan), imbalan rata-rata (Web Shopping), akurasi langkah/elemen (penjelajahan web), atau kemajuan/imbalan permainan (permainan kartu, teka-teki). Overall Score utama adalah rata-rata berbobot dari delapan skor lingkungan, dengan bobot dipilih untuk menyeimbangkan kesulitannya sehingga tidak ada satu tugas mudah pun yang mendominasi.
Verifikasi
Setiap tugas berjalan di lingkungan yang dapat dieksekusi dengan pemeriksa otomatis dan deterministik: lintasan multi-giliran agen diverifikasi secara program (misalnya skrip pemeriksa shell, keadaan akhir basis data, imbalan WebShop, atau kecocokan dengan aksi acuan). Tidak ada juri manusia; interaksi memiliki batas jumlah giliran maksimum, dan melampaui batas atau mengeluarkan aksi tidak valid dihitung sebagai gagal.
Mengapa penting
Ini salah satu tolok ukur terstandardisasi pertama yang menguji LLM sebagai agen, bukan penjawab satu giliran, melatih penalaran jangka panjang, penggunaan alat, dan pemulihan dari kesalahan; ia mengungkap kesenjangan lebar antara model API komersial terbaik dan model sumber terbuka pada tugas agen nyata.
Contoh penyelesaian
Tugas
Lingkungan «Sistem operasi». Di shell bash Ubuntu, agen diberi tahu: «Berapa banyak akun pengguna di sistem ini yang memakai /bin/bash sebagai shell login? Sebutkan angkanya.» Sebelum menjawab, ia boleh menjalankan beberapa perintah shell dalam beberapa giliran.
Solusi
grep -c ':/bin/bash$' /etc/passwd
Penjelasan
Bidang ketujuh (dipisahkan titik dua) pada tiap baris /etc/passwd adalah shell login, sehingga menghitung baris yang berakhiran :/bin/bash memberi jumlah akun ber-login bash; agen membaca angka itu dari keluaran perintah dan mengembalikannya lewat aksi answer(N) milik lingkungan. Penilaian: pemeriksa OS menjalankan skrip verifikasi dan menilai kiriman sebagai berhasil/gagal biner.

Belum ada skor terverifikasi yang dilaporkan untuk benchmark ini.