GiulioDER выпустила AMB, открытый и предварительно зарегистрированный бенчмарк, предназначенный для оценки эффективности слоёв памяти в кодовых агентах. В отличие от традиционных бенчмарков, ориентированных на релевантность поиска, AMB проверяет, действительно ли извлечённая память помогает агенту выполнять реальные задачи по написанию кода или приводит к худшим результатам.

  • Бенчмарк запускает Claude Code внутри изолированного репозитория, где исполняемые тесты оценивают полученные артефакты.
  • Он состязательно сконструирован с использованием отсутствующих, устаревших, заменённых, противоречивых, смежных и нерелевантных воспоминаний.
  • В открытом наборе данных содержится 195 предварительно созданных транскриптов сессий.
  • Отдельный сложный корпус масштабируется до 4 900 документов, включая 196 реальных документов и 4 704 синтетических отвлекающих объектов, примерно с 143 000 чанков.
  • Текущий набор в основном измеряет путь чтения и ещё не проверяет, учится ли слой памяти на собственной работе агента между сессиями.

Автор приглашает небольшие компании-разработчиков систем памяти протестировать свои системы без платы за участие, позволяя им опубликовать свою конфигурацию и результаты.