Los investigadores presentan ReFold, una capa de renderizado sin entrenamiento que comprime el contexto renderizado del modelo en agentes LLM de horizonte largo sin descartar el historial de interacción subyacente. Elimina la redundancia entre turnos reemplazando el contenido mostrado con marcadores y plegando los turnos finalizados en notas, utilizando renderizado por fragmentos para reescribir periódicamente el prefijo en caché.

  • ReFold elimina dos tipos de redundancia entre turnos: el contenido previamente mostrado y los turnos finalizados reportados por el agente.
  • El método utiliza renderizado por fragmentos para actualizar el prefijo en caché cada pocos pasos en lugar de en cada paso.
  • Todas las eliminaciones son estrictamente reversibles, lo que permite la restauración desde el historial si una eliminación es incorrecta.
  • Las evaluaciones en cinco benchmarks y dos LLMs de vanguardia muestran una reducción de hasta 2.5x en el consumo de tokens y la mitad de memoria de KV-cache.
  • Con presupuestos de contexto limitados, ReFold evita hasta el 92% de las compacciones forzadas.
  • En cargas de trabajo de servicio concurrente, reduce los retrasos de cola de solicitudes hasta un 100%, acelera la inferencia hasta 1.7x y reduce los costos hasta 3.4x.

ReFold está diseñado como una solución plug-and-play para arneses estándar estilo ReAct, abordando las limitaciones de los métodos existentes de gestión predictiva de contexto que introducen sobrecarga en tiempo de ejecución e invalidan las cachés de prefijo.