对八项模型的研究表明,代理记忆并非通用特性,而是一种必须针对特定模型能力进行校准的剂量。ALTK-Evolve 框架从代理的历史轨迹中提取指导原则,并在推理阶段注入这些原则而无需更新权重,结果表明最优的记忆策略在不同模型层级之间存在显著差异。
- 具有提升空间的强模型从完整的指导原则集中获益最多,例如 DeepSeek-V3.2 的任务完成率提升了 +9.5pp。
- 较弱的模型在采用精简核心加任务特定指导原则的精选检索时表现最佳,使得 gpt-oss-120b 仅增加 +5% 的 token 成本即可获得 +16.1pp 的提升。
- 饱和模型未显示出可测量的增益,表明它们在所测试的任务上已达到性能上限。
- 与注入完整指导原则集相比,精选检索为较弱的模型提供了更高的准确性和更低的成本。
作者得出结论,记忆应当进行校准而非仅仅积累,因为给予代理超出其利用能力的经验并不会带来益处。他们建议对弱模型使用精简核心,对强模型使用提示缓存,以在生产环境中保持成本可控。