Benchmark · agentic

τ²-bench

17 hasil 13 model

τ²-bench adalah versi terbaru dari τ-bench yang menguji agen AI percakapan pengguna alat (tool) pada tugas «kontrol ganda» (dual-control), di mana baik agen maupun pengguna yang disimulasikan sama-sama dapat melakukan tindakan untuk menyelesaikan pekerjaan. Metrik utamanya adalah persentase tugas yang berhasil diselesaikan (rata-rata imbalan antar tugas).

Selengkapnya
Contoh
Sebuah skenario dukungan teknis: agen memeriksa akun pelanggan dan mengikuti kebijakan domain sambil memandu pengguna yang disimulasikan untuk melakukan langkah-langkah di perangkatnya sendiri (misalnya mengubah suatu pengaturan), dan keduanya harus berkoordinasi untuk menyelesaikan masalah.
Penilaian
Setiap tugas diakhiri dengan pemeriksaan otomatis apakah keadaan akhir sistem/basis data sesuai dengan hasil yang diminta, sehingga menghasilkan imbalan per tugas; skor yang dilaporkan adalah persentase tugas yang terselesaikan (atau rata-rata imbalan).
Verifikasi
Penerimaan sepenuhnya dilakukan secara program — lingkungan membandingkan keadaan akhir (dan tindakan yang diperlukan) dengan hasil yang diharapkan, tanpa penilaian manusia, sehingga sebuah tugas hanya dihitung jika hasilnya cocok.
Mengapa penting
Ini penting karena asisten nyata sering kali tidak bisa bertindak sendiri — mereka harus mengarahkan dan berkoordinasi dengan pengguna — dan skema kontrol ganda ini mengungkap kegagalan komunikasi dan koordinasi yang terlewat oleh benchmark alat berpelaku tunggal.
Contoh penyelesaian
Tugas
τ²-bench, domain telekomunikasi (dual-control): seorang pengguna tersimulasi menulis, «Sejak pagi ini data seluler saya tidak berfungsi, tetapi telepon dan SMS masih bisa.» Dengan dokumen kebijakan operator dan berbagai tool — ditambah aksi perangkat yang bisa dilakukan pengguna sendiri di ponselnya —, autentikasi pelanggan, diagnosis kerusakannya, dan pulihkan data seluler.
Solusi
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
Penjelasan
Karena telepon dan SMS berfungsi sementara data mati pada line yang active dan tanpa gangguan jaringan, kerusakan ada di sisi perangkat, sehingga pohon pemecahan masalah dari kebijakan menyelesaikannya dengan memandu pengguna mengaktifkan kembali Mobile Data (dan melarang kredit niat baik untuk perbaikan yang dilakukan sendiri). τ²-bench memberi reward per tugas (0/1) dengan memeriksa apakah environment/database mencapai keadaan akhir yang diharapkan dan apakah semua aksi yang diwajibkan serta informasi yang disampaikan sudah ada, lalu melaporkan keandalan pada percobaan berulang melalui metrik pass^k.
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT-5 · 63.5 · 2025-08-07 GPT‑5 · 96.7 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT-5 GPT‑5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
Linimasa
Tanggal Model Skor Sumber
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI merilis Pokee-Isaac 28B, model konteks 10M-token untuk deployment dalam batas yang ditentukan
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia menskalakan model agentic di seluruh aplikasi skenario penuh
2026-04-25 GPT-5.5 98.0% OpenAI merilis GPT-5.5, model yang dilatih ulang dari awal dengan pemrosesan omnimodal asli
2026-02-10 Step 3.5 Flash 88.2% Langkah 3.5 Flash: model MoE aktif 11B mencapai kinerja agentic tingkat terdepan
2026-02-05 Claude Opus 4.6 91.9% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI merilis GPT-5.2, mengungguli Gemini 3 dalam benchmark pemrograman dan penalaran
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI memperkenalkan GPT-5.2 dengan kemampuan kerja pengetahuan profesional terkini
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI merilis Kimi K2 Thinking dengan penggunaan alat agentic
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter
2025-08-07 GPT-5 63.5% OpenAI meluncurkan GPT-5 terpadu dengan penataan rute waktu nyata dan akses gratis
2025-08-07 GPT‑5 96.7% OpenAI merilis API GPT-5 dengan peningkatan coding dan agentic
2025-08-06 GLM-4.5 90.6% Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek
2025-07-28 Kimi K2 66.1% Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
2025-07-28 Kimi K2 66.1% Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
2025-02-24 Claude 3.7 Sonnet 81.2% Anthropic merilis Claude 3.7 Sonnet dengan kontrol penalaran dinamis
2024-10-22 Claude 3.5 Sonnet 69.2% Anthropic meningkatkan Claude 3.5 Sonnet, merilis Claude 3.5 Haiku dan beta penggunaan komputer