Исследователи представляют ReFold, слой рендеринга, не требующий дообучения, который сжимает отрендеренный контекст модели у долгосрочных LLM-агентов без потери исходной истории взаимодействий. Он устраняет межраундовую избыточность, заменяя отображаемый контент заглушками и сворачивая завершённые раунды в заметки, используя фрагментированный рендеринг для периодического перезаписывания кэшированного префикса.

  • ReFold устраняет два типа межраундовой избыточности: ранее отображённый контент и отчёт агента о завершённых раундах.
  • Метод использует фрагментированный рендеринг для обновления кэшированного префикса каждые несколько шагов, а не на каждом шаге.
  • Все удаления строго обратимы, что позволяет восстановить данные из истории при ошибочном удалении.
  • Оценка по пяти бенчмаркам и двум передовым LLM показывает снижение потребления токенов до 2.5 раз и уменьшение памяти KV-cache вдвое.
  • При ограниченных бюджетах контекста ReFold избегает до 92% принудительных компиляций.
  • В конкурентных рабочих нагрузках обслуживания он снижает задержки очереди запросов до 100%, ускоряет инференс до 1.7 раз и сокращает затраты до 3.4 раз.

ReFold разработан как решение типа plug-and-play для стандартных ReAct-подобных каркасов, устраняя ограничения существующих методов управления контекстом на основе предсказаний, которые вносят накладные расходы во время выполнения и инвалидируют кэши префиксов.