Исследователи представляют ReFold, слой рендеринга, не требующий дообучения, который сохраняет историю взаимодействий, одновременно сжимая отрендеренный контекст модели для LLM-агентов с длительным горизонтом. Он устраняет межшаговую избыточность, заменяя отображаемый контент заглушками и сворачивая завершённые шаги в заметки, используя почанное переписывание для поддержания префиксных кэшей.

  • Удаляет контент, уже показанный на предыдущих шагах, и сворачивает завершённые шаги, сообщённые агентом, в однострочные заметки.
  • Использует почаный рендеринг для переписывания кэшированного префикса один раз каждые несколько шагов, а не на каждом шаге.
  • Гарантирует, что все удаления строго обратимы, позволяя восстановить данные из истории при ошибочном удалении.
  • Снижает потребление токенов до 2.5 раз и уменьшает память KV-cache в два раза на сессию без снижения успешности выполнения задач.
  • Избегает до 92% принудительных компактов при ограниченных бюджетах контекста и сокращает задержки очереди запросов до 100%.

ReFold работает как готовое решение plug-and-play в стандартных ReAct-подобных средах, ускоряя инференс до 1.7 раз и снижая затраты на инференс до 3.4 раза.