研究者らは、長期LLMエージェントのためにモデルのレンダリングされたコンテキストを圧縮しながら対話履歴を保持する学習不要のレンダリング層であるReFoldを紹介している。これは表示されたコンテンツをスタブに置き換え、完了したターンをノートに折りたたむことでターン間の冗長性を除去し、チャンク単位での書き換えを使用してプレフィックスキャッシュを維持する。
- 以前のターンですでに表示されたコンテンツを除去し、エージェントが報告した完了したターンを1行のノートに折りたたむ。
- チャンク単位レンダリングを使用し、すべてのステップではなく数ステップごとにキャッシュされたプレフィックスを1回書き換える。
- すべての除去が厳密に可逆であることを保証し、誤った除去が発生した場合に履歴から復元可能にする。
- タスクの成功率を低下させることなく、トークン消費量を最大2.5倍削減し、セッションあたりのKVキャッシュメモリを半減させる。
- 制約されたコンテキスト予算の下で強制圧縮の最大92%を回避し、リクエストキューイング遅延を最大100%削減する。
ReFoldは標準的なReActスタイルのハルネス全体でプラグアンドプレイソリューションとして動作し、推論速度を最大1.7倍に加速しつつ、推論コストを最大3.4倍削減する。