GiulioDER telah merilis AMB, sebuah benchmark terbuka dan terdaftar sebelumnya yang dirancang untuk mengevaluasi efektivitas lapisan memori dalam agen pemrograman. Berbeda dengan benchmark tradisional yang berfokus pada relevansi pengambilan, AMB menguji apakah memori yang diambil benar-benar membantu agen menyelesaikan tugas pemrograman nyata atau justru menyebabkan hasil yang lebih buruk.
- Benchmark ini menjalankan Claude Code di dalam repositori terisolasi di mana tes eksekutabel menilai artefak yang dihasilkan.
- Benchmark ini dibangun secara adversarial dengan memori yang hilang, usang, digantikan, kontradiktif, bersebelahan, dan tidak relevan.
- Umpan publik berisi 195 transkrip sesi yang telah disusun sebelumnya.
- Korpus keras terpisah diskalakan hingga 4.900 dokumen, termasuk 196 dokumen nyata dan 4.704 pengalih sintetik, dengan sekitar 143.000 potongan (chunks).
- Suite saat ini terutama mengukur jalur baca dan belum mengukur apakah lapisan memori belajar dari pekerjaan agen sendiri lintas sesi.
Penulis mengundang vendor memori kecil untuk menguji sistem mereka tanpa biaya partisipasi, memungkinkan mereka memublikasikan konfigurasi dan hasil mereka.