Исследователи представляют ReFold, слой рендеринга, не требующий дообучения, который сжимает отрендеренный контекст модели у долгосрочных LLM-агентов без потери исходной истории взаимодействий. Он устраняет межраундовую избыточность, заменяя отображаемый контент заглушками и сворачивая завершённые раунды в заметки, используя фрагментированный рендеринг для периодического перезаписывания кэшированного префикса.
- ReFold устраняет два типа межраундовой избыточности: ранее отображённый контент и отчёт агента о завершённых раундах.
- Метод использует фрагментированный рендеринг для обновления кэшированного префикса каждые несколько шагов, а не на каждом шаге.
- Все удаления строго обратимы, что позволяет восстановить данные из истории при ошибочном удалении.
- Оценка по пяти бенчмаркам и двум передовым LLM показывает снижение потребления токенов до 2.5 раз и уменьшение памяти KV-cache вдвое.
- При ограниченных бюджетах контекста ReFold избегает до 92% принудительных компиляций.
- В конкурентных рабочих нагрузках обслуживания он снижает задержки очереди запросов до 100%, ускоряет инференс до 1.7 раз и сокращает затраты до 3.4 раз.
ReFold разработан как решение типа plug-and-play для стандартных ReAct-подобных каркасов, устраняя ограничения существующих методов управления контекстом на основе предсказаний, которые вносят накладные расходы во время выполнения и инвалидируют кэши префиксов.