Les chercheurs présentent ReFold, une couche de rendu sans entraînement qui préserve l'historique des interactions tout en compressant le contexte rendu du modèle pour les agents LLM à long terme. Il élimine la redondance inter-tour en remplaçant le contenu affiché par des repères et en pliant les tours terminés rapportés par l'agent dans des notes, en utilisant une réécriture par blocs pour maintenir les caches de préfixe.
- Supprime le contenu déjà affiché dans les tours précédents et plie les tours terminés rapportés par l'agent dans des notes d'une seule ligne.
- Utilise un rendu par blocs pour réécrire le préfixe mis en cache une fois tous les quelques pas au lieu de chaque pas.
- Garantit que toutes les suppressions sont strictement réversibles, permettant la restauration à partir de l'historique si une suppression est incorrecte.
- Réduit la consommation de tokens jusqu'à 2,5x et divise par deux la mémoire du cache KV par session sans dégrader les taux de réussite des tâches.
- Évite jusqu'à 92 % des compactations forcées sous des budgets de contexte limités et réduit les délais de file d'attente des requêtes jusqu'à 100 %.
ReFold fonctionne comme une solution plug-and-play sur les harnais standard de type ReAct, accélérant l'inférence jusqu'à 1,7x tout en réduisant les coûts d'inférence jusqu'à 3,4x.