Los investigadores presentan ReFold, una capa de renderizado sin entrenamiento que preserva el historial de interacciones mientras comprime el contexto renderizado del modelo para agentes LLM de horizonte prolongado. Elimina la redundancia entre turnos al reemplazar el contenido mostrado con marcadores y plegar los turnos finalizados reportados por el agente en notas de una sola línea, utilizando reescritura fragmentada para mantener las cachés de prefijo.
- Elimina el contenido ya mostrado en turnos anteriores y pliega los turnos finalizados reportados por el agente en notas de una sola línea.
- Utiliza renderizado fragmentado para reescribir el prefijo en caché cada pocos pasos en lugar de en cada paso.
- Garantiza que todas las eliminaciones sean estrictamente reversibles, permitiendo la restauración desde el historial si una eliminación es incorrecta.
- Reduce el consumo de tokens hasta 2.5 veces y reduce a la mitad la memoria de la caché KV por sesión sin degradar las tasas de éxito de la tarea.
- Evita hasta el 92% de las compacciones forzadas bajo presupuestos de contexto limitados y reduce los retrasos en la cola de solicitudes hasta un 100%.
ReFold opera como una solución plug-and-play en arneses estándar estilo ReAct, acelerando la inferencia hasta 1.7 veces mientras reduce los costos de inferencia hasta 3.4 veces.