Les chercheurs présentent ReFold, une couche de rendu sans entraînement qui compresse le contexte rendu du modèle dans les agents LLM à long terme sans perdre l'historique des interactions sous-jacent. Elle élimine la redondance inter-tours en remplaçant le contenu affiché par des jetons et en pliant les tours terminés en notes, en utilisant un rendu par blocs pour réécrire périodiquement le préfixe mis en cache.

  • ReFold élimine deux types de redondance inter-tours : le contenu précédemment affiché et les tours terminés signalés par l'agent.
  • La méthode utilise un rendu par blocs pour mettre à jour le préfixe mis en cache tous les quelques pas plutôt qu'à chaque étape.
  • Toutes les suppressions sont strictement réversibles, permettant une restauration à partir de l'historique si une suppression est incorrecte.
  • Les évaluations sur cinq benchmarks et deux LLM de pointe montrent une réduction jusqu'à 2,5x de la consommation de tokens et une division par deux de la mémoire du cache KV.
  • Avec des budgets de contexte limités, ReFold évite jusqu'à 92 % des compactages forcés.
  • Dans les charges de travail de service concurrentes, il réduit les délais d'attente des requêtes jusqu'à 100 %, accélère l'inférence jusqu'à 1,7x et réduit les coûts jusqu'à 3,4x.

ReFold est conçu comme une solution plug-and-play pour les harnais standard de type ReAct, répondant aux limites des méthodes existantes de gestion contextuelle prédictive qui introduisent une surcharge d'exécution et invalident les caches de préfixe.