연구자들은 ReFold를 소개하는데, 이는 모델이 렌더링한 컨텍스트를 하위 상호작용 이력을 버리지 않고 압축하는 학습 불필요 렌더링 레이어로, 장기적 LLM 에이전트에서 사용됩니다. 표시된 콘텐츠를 스텁으로 대체하고 완료된 턴을 노트로 폴딩하여 턴 간 중복성을 제거하며, 청크 렌더링을 사용하여 캐시된 접두사를 주기적으로 재작성합니다.
- ReFold는 두 가지 유형의 턴 간 중복성을 제거합니다: 이전에 표시된 콘텐츠와 에이전트가 보고한 완료된 턴.
- 이 방법은 매 단계가 아닌 몇 단계마다 캐시된 접두사를 업데이트하기 위해 청크 렌더링을 사용합니다.
- 모든 제거 작업은 엄격히 가역적이며, 잘못된 제거 시 이력에서 복원할 수 있습니다.
- 5개 벤치마크와 2개의 최첨단 LLM에 대한 평가는 토큰 소비량을 최대 2.5배 감소시키고 KV-cache 메모리를 절반으로 줄였음을 보여줍니다.
- 제한된 컨텍스트 예산 하에서 ReFold는 강제 컴팩션의 최대 92%를 방지합니다.
- 동시 서빙 워크로드에서 요청 대기 지연을 최대 100%까지 줄이고, 추론 속도를 최대 1.7배 가속화하며, 비용을 최대 3.4배 절감합니다.
ReFold는 기존 예측형 컨텍스트 관리 방식이 런타임 오버헤드를 도입하고 접두사 캐시를 무효화하는 한계를 해결하기 위해 표준 ReAct 스타일 하니스를 위한 플러그 앤 플레이 솔루션으로 설계되었습니다.