Microsoft dan Hugging Face merilis ThinkingBox, sebuah benchmark yang mengevaluasi agen AI dengan menilai dampaknya terhadap keadaan database terisolasi, bukan hanya panggilan alat atau respons akhir. Di seluruh 507 alur kerja bisnis stateful yang dijalankan masing-masing 20 kali terhadap berbagai model LLM, studi menemukan bahwa meskipun banyak agen menghasilkan panggilan alat yang valid, mereka sering meninggalkan nilai yang salah, efek tambahan yang tidak diinginkan, atau efek wajib yang hilang di backend.
- Claude Opus 5.5 memimpin secara keseluruhan dengan skor pass@1 sebesar 67,16%, tetapi hanya tiga model yang mempertahankan sebagian besar skor percobaan tunggal mereka di seluruh 20 pengulangan: GPT-6 Astra (78%), Claude Opus 5.5 (71%), dan Claude Opus 5 (71%).
- Kimi-K3 menyelesaikan cakupan tugas paling luas (93,89% setidaknya sekali) tetapi termasuk yang paling tidak konsisten, berhasil dalam semua 20 percobaan hanya untuk 13,41% dari tugas.
- GPT-5.6 Sol menawarkan biaya terendah per percobaan tugas sukses sebesar $0,127, sementara GPT-5.4 adalah opsi terpercaya termurah dengan biaya $6,80 per tugas yang berhasil di seluruh 20 percobaan.
- Sekitar empat dari lima kegagalan dikaitkan dengan masalah penanganan alat, seperti gagal pulih dari kesalahan atau pencarian kosong, bukan defisit penalaran.
Para penulis berargumen bahwa skor pass@1 saja tidak cukup untuk keandalan penyebaran dan merekomendasikan memperlakukan tingkat konsistensi 20/20 sebagai masukan desain, memeriksa keadaan terminal sebelum mengomitis perubahan di produksi.