Indeks Limbah Agen telah mencetak 341.054 lintasan agen dari 11 dataset publik untuk mengidentifikasi inefisiensi seperti loop, percobaan buta, output alat yang terlalu besar, dan jalankan yang ditinggalkan. Analisis mengungkapkan bahwa perilaku loop dan retry sangat umum pada model lemah seperti Llama agents tetapi jarang terjadi pada Claude 3.7 Sonnet dan Qwen3-Coder-480B.

  • Output alat yang terlalu besar bervariasi secara signifikan berdasarkan scaffold, dengan OpenHands dan SWE-agent membawa observasi >20k karakter di lebih dari setengah jalankan.
  • Separuh kelima terpanjang jalankan berdasarkan jumlah langkah mengonsumsi 40% perkiraan biaya sambil menyelesaikan pada tingkat yang lebih rendah dibandingkan separuh kelima terpendek.
  • Proyek ini menyediakan pipeline dan detektor untuk membangun kembali Indeks dari hub, dengan tabel tersedia secara online untuk verifikasi komunitas.

Para penulis menyediakan mekanisme koreksi untuk penerbit dataset dan bertujuan meningkatkan transparansi kinerja agen pemrograman.