Pesquisadores apresentam o ReFold, uma camada de renderização sem treinamento que preserva o histórico de interações enquanto comprime o contexto renderizado do modelo para agentes LLM de longo prazo. Ele remove a redundância entre turnos substituindo o conteúdo exibido por stubs e dobrando os turnos finalizados relatados pelo agente em notas de uma linha, utilizando reescrita em blocos para manter os caches de prefixo.

  • Remove o conteúdo já mostrado em turnos anteriores e dobra os turnos finalizados relatados pelo agente em notas de uma linha.
  • Usa renderização em blocos para reescrever o prefixo em cache a cada poucos passos, em vez de a cada passo.
  • Garante que todas as remoções sejam estritamente reversíveis, permitindo restauração a partir do histórico se uma remoção estiver incorreta.
  • Reduz o consumo de tokens em até 2,5x e reduz pela metade a memória da KV-cache por sessão sem degradar as taxas de sucesso das tarefas.
  • Evita até 92% das compactações forçadas sob orçamentos de contexto limitados e reduz os atrasos de enfileiramento de solicitações em até 100%.

O ReFold opera como uma solução plug-and-play em harnesses padrão estilo ReAct, acelerando a inferência em até 1,7x enquanto corta os custos de inferência em até 3,4x.