연구자들은 ReFold를 소개합니다. 이는 상호작용 이력을 보존하면서 장기적 LLM 에이전트를 위한 모델의 렌더링된 컨텍스트를 압축하는 학습 불필요한 렌더링 레이어입니다. 표시된 콘텐츠를 스텁으로 대체하고 완료된 턴을 노트로 폴딩하여 턴 간 중복성을 제거하며, 청크 단위 재작성을 사용하여 프리픽스 캐시를 유지합니다.
- 이전에 이미 표시된 콘텐츠를 제거하고 에이전트가 보고한 완료된 턴을 한 줄 노트로 폴딩합니다.
- 매 단계가 아닌 몇 단계마다 한 번씩 캐시된 프리픽스를 재작성하는 청크 단위 렌더링을 사용합니다.
- 모든 제거 작업이 엄격히 가역적임을 보장하여, 잘못된 제거 시 이력에서 복원할 수 있습니다.
- 토큰 소비량을 최대 2.5배까지 줄이고 작업 성공률을 저하시키지 않으면서 세션당 KV-cache 메모리를 절반으로 줄입니다.
- 제한된 컨텍스트 예산 하에서 강제 컴팩션을 최대 92%까지 피하고 요청 대기 지연을 최대 100%까지 줄입니다.
ReFold는 표준 ReAct 스타일 하니스 전반에 걸쳐 플러그 앤 플레이 솔루션으로 작동하며, 추론 속도를 최대 1.7배 가속화하고 추론 비용을 최대 3.4배 절감합니다.