Benchmark · agentic
τ-bench
τ-bench mengukur seberapa baik agen AI menangani percakapan layanan pelanggan yang berlangsung dalam beberapa giliran sambil memanggil tools dan API untuk memenuhi permintaan pengguna. Skornya adalah persentase tugas yang diselesaikan agen dengan benar.
Selengkapnya
- Contoh
- Sebuah tugas di bidang ritel atau maskapai penerbangan — misalnya, pengguna meminta agen untuk membatalkan atau mengubah pesanan, dan agen harus menanyakan detail yang diperlukan lalu memanggil API backend yang tepat sambil mengikuti aturan dan kebijakan domain tersebut.
- Penilaian
- Metriknya adalah proporsi tugas yang diselesaikan dengan benar; sebuah tugas dianggap selesai ketika keadaan akhir basis data atau lingkungan sesuai dengan hasil yang diharapkan. Hasil biasanya dilaporkan sebagai tingkat keberhasilan (pass@1), dengan varian pass^k yang mengukur konsistensi pada eksekusi berulang.
- Verifikasi
- Verifikasi dilakukan secara otomatis, bukan dinilai manusia: setelah percakapan, benchmark membandingkan keadaan akhir sistem (dan informasi yang diberikan kepada pengguna) dengan hasil yang telah ditentukan sebelumnya, sehingga hanya kecocokan objektif yang dihitung sebagai berhasil.
- Mengapa penting
- Ia mencerminkan kasus penggunaan yang realistis dan penting secara komersial — agen yang harus sekaligus berbicara dengan pengguna dan bertindak melalui tools di bawah aturan bisnis — serta menyingkap celah keandalan, karena model yang berhasil sekali sering gagal saat mencoba tugas yang sama lagi.
Contoh penyelesaian
Tugas
Di domain retail τ-bench, seorang pengguna tersimulasi berkata kepada agen: «Halo, saya ingin membatalkan pesanan #W2611340 — saya memesannya karena keliru.» Sesuai kebijakan toko (hanya pesanan yang masih berstatus 'pending' yang boleh dibatalkan, dan alasannya harus berupa nilai yang diizinkan), agen harus mengautentikasi pengguna, memverifikasi pesanan, mengonfirmasi dengan pengguna, lalu membatalkannya melalui pemanggilan tool.
Solusi
# 1) Authenticate the user (policy: verify identity before any action)
find_user_id_by_email(email="mia.li.3818@example.com")
# 2) Look up the order and confirm status == "pending"
get_order_details(order_id="#W2611340")
# 3) After the user confirms, cancel with an allowed reason enum
cancel_pending_order(order_id="#W2611340", reason="ordered by mistake")
Penjelasan
Kebijakan hanya mengizinkan pembatalan pesanan berstatus 'pending' dan membatasi alasan pada dua nilai enum ('no longer needed' / 'ordered by mistake'), sehingga agen lebih dulu mengautentikasi, memeriksa status, memperoleh konfirmasi pengguna, baru kemudian melakukan pemanggilan tulis. τ-bench menilai dengan membandingkan keadaan akhir basis data dengan keadaan target beranotasi (pesanan kini 'cancelled') dan melaporkan keandalan pass^k pada percobaan berulang.
Belum ada skor terverifikasi yang dilaporkan untuk benchmark ini.