研究人员推出了 ReFold,这是一种免训练的渲染层,能够在不丢弃底层交互历史的情况下,压缩长周期 LLM 智能体中的模型渲染上下文。它通过将显示内容替换为占位符并将已完成的回合折叠为笔记来消除回合间冗余,并使用分块渲染定期重写缓存的前缀。
- ReFold 消除了两种类型的回合间冗余:先前显示的内容和智能体报告的已完成回合。
- 该方法使用分块渲染每隔几步更新一次缓存前缀,而不是每一步都更新。
- 所有删除操作都是严格可逆的,如果删除错误,可以从历史记录中恢复。
- 在五个基准测试和两个前沿 LLM 上的评估显示,令牌消耗量最多减少 2.5 倍,KV 缓存内存减半。
- 在受限上下文预算下,ReFold 避免了高达 92% 的强制压缩。
- 在并发服务工作负载中,它将请求排队延迟最多降低 100%,推理速度提升多达 1.7 倍,并将成本削减多达 3.4 倍。
ReFold 被设计为标准 ReAct 风格框架的即插即用解决方案,旨在解决现有预测性上下文管理方法带来的运行时开销和使前缀缓存失效的局限性。