Pesquisadores apresentam o ReFold, uma camada de renderização sem treinamento que comprime o contexto renderizado do modelo em agentes LLM de longo prazo sem descartar o histórico de interação subjacente. Ele remove redundância entre rodadas substituindo o conteúdo exibido por stubs e dobrando as rodadas concluídas em notas, usando renderização em blocos para reescrever periodicamente o prefixo em cache.

  • O ReFold elimina dois tipos de redundância entre rodadas: conteúdo previamente exibido e rodadas concluídas relatadas pelo agente.
  • O método usa renderização em blocos para atualizar o prefixo em cache a cada poucos passos, em vez de a cada passo.
  • Todas as remoções são estritamente reversíveis, permitindo restauração do histórico se uma remoção estiver incorreta.
  • Avaliações em cinco benchmarks e dois LLMs de ponta mostram redução de até 2,5x no consumo de tokens e metade da memória do KV-cache.
  • Sob orçamentos de contexto limitados, o ReFold evita até 92% das compactações forçadas.
  • Em cargas de trabalho de serviço concorrente, reduz atrasos de fila de requisições em até 100%, acelera a inferência em até 1,7x e corta custos em até 3,4x.

O ReFold é projetado como uma solução plug-and-play para harnesses padrão estilo ReAct, abordando as limitações dos métodos existentes de gerenciamento de contexto preditivo que introduzem overhead de tempo de execução e invalidam caches de prefixo.