Исследователи представляют ReFold, слой рендеринга, не требующий дообучения, который сохраняет историю взаимодействий, одновременно сжимая отрендеренный контекст модели для LLM-агентов с длительным горизонтом. Он устраняет межшаговую избыточность, заменяя отображаемый контент заглушками и сворачивая завершённые шаги в заметки, используя почанное переписывание для поддержания префиксных кэшей.
- Удаляет контент, уже показанный на предыдущих шагах, и сворачивает завершённые шаги, сообщённые агентом, в однострочные заметки.
- Использует почаный рендеринг для переписывания кэшированного префикса один раз каждые несколько шагов, а не на каждом шаге.
- Гарантирует, что все удаления строго обратимы, позволяя восстановить данные из истории при ошибочном удалении.
- Снижает потребление токенов до 2.5 раз и уменьшает память KV-cache в два раза на сессию без снижения успешности выполнения задач.
- Избегает до 92% принудительных компактов при ограниченных бюджетах контекста и сокращает задержки очереди запросов до 100%.
ReFold работает как готовое решение plug-and-play в стандартных ReAct-подобных средах, ускоряя инференс до 1.7 раз и снижая затраты на инференс до 3.4 раза.