GiulioDER 发布了 AMB,这是一个开放且预注册的基准,旨在评估编码代理中记忆层的有效性。与侧重于检索相关性的传统基准不同,AMB 测试检索到的记忆是否真的能帮助代理完成实际的编码任务,或者导致更差的结果。
- 该基准在沙盒存储库内运行 Claude Code,可执行测试对生成的工件进行评分。
- 它通过缺失、过时、被取代、矛盾、相邻和不相关的记忆进行对抗性构建。
- 公开数据流包含 195 个预撰写的会话转录。
- 单独的困难语料库扩展到 4,900 份文档,包括 196 份真实文档和 4,704 个合成干扰项,大约有 143,000 个块。
- 当前套件主要测量读取路径,尚未测量记忆层是否从代理跨会话的自身工作中学习。
作者正在邀请小型记忆供应商免费测试他们的系统,允许他们发布其配置和结果。