GiulioDER는 코딩 에이전트의 메모리 계층 효과를 평가하기 위해 설계된 오픈되고 사전 등록된 벤치마크인 AMB를 출시했습니다. 검색 관련성에 중점을 둔 기존 벤치마크와 달리, AMB는 검색된 메모리가 실제로 에이전트가 실제 코딩 작업을 완료하는 데 도움이 되는지, 아니면 더 나쁜 결과를 초래하는지를 테스트합니다.

  • 이 벤치마크는 샌드박스화된 저장소 내에서 Claude Code를 실행하며, 실행 가능한 테스트가 생성된 아티팩트를 평가합니다.
  • 결핍된, 낡은, 대체된, 모순되는, 인접한, 관련 없는 메모리로 적대적으로 구성되었습니다.
  • 공개 피드에는 195개의 사전 작성된 세션 트랜스크립트가 포함되어 있습니다.
  • 별도의 하드 코퍼스는 약 143,000개의 청크를 포함하여 4,900개의 문서로 확장되며, 이 중 196개는 실제 문서이고 4,704개는 합성 방해 요소입니다.
  • 현재 스위트는 주로 읽기 경로를 측정하며, 메모리 계층이 세션 전반에 걸쳐 에이전트의 자체 작업에서 학습하는지를 아직 측정하지 않습니다.

저자는 참여 비용 없이 자신의 시스템을 테스트할 수 있도록 작은 메모리 벤더들을 초대하고 있으며, 이를 통해 설정과 결과를 게시할 수 있습니다.