GiulioDER a publié AMB, un benchmark ouvert et préenregistré conçu pour évaluer l'efficacité des couches de mémoire dans les agents de codage. Contrairement aux benchmarks traditionnels qui se concentrent sur la pertinence de la récupération, AMB teste si les mémoires récupérées aident réellement un agent à accomplir des tâches de codage concrètes ou entraînent de pires résultats.

  • Le benchmark exécute Claude Code dans un référentiel isolé où des tests exécutables évaluent les artefacts résultants.
  • Il est construit de manière adversariale avec des mémoires absentes, obsolètes, remplacées, contradictoires, adjacentes et non pertinentes.
  • Le flux public contient 195 transcriptions de sessions pré-rédigées.
  • Un corpus dur distinct s'étend à 4 900 documents, incluant 196 documents réels et 4 704 leurres synthétiques, avec environ 143 000 chunks.
  • La suite actuelle mesure principalement le chemin de lecture et ne mesure pas encore si une couche de mémoire apprend du travail de l'agent lui-même à travers les sessions.

L'auteur invite les petits fournisseurs de mémoire à tester leurs systèmes sans frais de participation, leur permettant de publier leur configuration et leurs résultats.