GiulioDER ने AMB जारी किया है, जो एक खुला और preregistered benchmark है जिसका डिज़ाइन कोडिंग एजेंट्स में मेमोरी लेयर्स की प्रभावशीलता का आकलन करने के लिए किया गया है। पारंपरिक benchmarks के विपरीत जो retrieval relevance पर केंद्रित होते हैं, AMB यह परीक्षण करता है कि retrieve किए गए memories वास्तव में एक एजेंट को वास्तविक कोडिंग कार्यों को पूरा करने में मदद करते हैं या खराब परिणाम देते हैं।

  • benchmark एक sandboxed repository के अंदर Claude Code चलाता है जहाँ executable tests resulting artifacts को grade करते हैं।
  • यह absent, stale, superseded, contradictory, adjacent, और irrelevant memories के साथ adversarially बनाया गया है।
  • public feed में 195 pre-authored session transcripts शामिल हैं।
  • एक अलग hard corpus 4,900 documents तक विस्तारित होता है, जिसमें 196 real documents और 4,704 synthetic distractors शामिल हैं, लगभग 143,000 chunks के साथ।
  • वर्तमान suite मुख्य रूप से read path को मापता है और यह अभी तक माप नहीं करता कि क्या एक memory layer agent के अपने काम से sessions के बीच सीखती है।

लेखक छोटे memory vendors को किसी participation fee के बिना अपनी प्रणालियों का परीक्षण करने के लिए आमंत्रित कर रहा है, जिससे वे अपनी configuration और results publish कर सकें।