研究人员推出了 ReFold,这是一种无需训练的渲染层,能够在压缩长周期 LLM 智能体渲染上下文的同时保留交互历史。它通过将显示内容替换为占位符并将已完成的回合折叠为注释来消除回合间的冗余,并使用分块重写来维护前缀缓存。

  • 移除早期回合中已显示的内容,并将智能体报告的已完成回合折叠为一行注释。
  • 使用分块渲染,每隔几步重写一次缓存的前缀,而不是在每一步都进行重写。
  • 确保所有移除操作严格可逆,如果移除错误,可以从历史记录中恢复。
  • 将令牌消耗量减少多达 2.5 倍,并将每个会话的 KV 缓存内存减半,且不会降低任务成功率。
  • 在受限上下文预算下避免高达 92% 的强制压缩,并将请求排队延迟减少多达 100%。

ReFold 作为即插即用解决方案适用于标准的 ReAct 风格框架,将推理速度提升多达 1.7 倍,同时将推理成本降低多达 3.4 倍。