研究者らは、ReFoldを提案した。これは学習不要のレンダリングレイヤーであり、基盤となる対話履歴を破棄することなく、長期のLLMエージェントにおけるモデルが生成したコンテキストを圧縮する。表示内容をスタブに置き換え、完了したターンをノートに折りたたむことでターン間の冗長性を除去し、チャンク化されたレンダリングを用いてキャッシュされた接頭辞を定期的に書き換える。
- ReFoldは2種類のターン間冗長性、すなわち以前に表示されたコンテンツとエージェントが報告した完了ターンを除去する。
- この手法は、すべてのステップではなく数ステップごとにキャッシュされた接頭辞を更新するためにチャンク化されたレンダリングを使用する。
- すべての除去操作は厳密に可逆であり、誤った除去が行われた場合に履歴から復元可能である。
- 5つのベンチマークと2つの最先端LLMでの評価により、トークン消費量が最大2.5倍削減され、KVキャッシュメモリが半減した。
- コンテキスト予算が制限された条件下では、ReFoldは強制圧縮の最大92%を回避する。
- 並行サービングワークロードにおいて、リクエストキューイング遅延を最大100%短縮し、推論速度を最大1.7倍加速し、コストを最大3.4倍削減した。
ReFoldは、ランタイムオーバーヘッドを導入し接頭辞キャッシュを無効化する既存の予測的コンテキスト管理手法の制限に対処するため、標準的なReActスタイルのハルネスに対してプラグアンドプレイソリューションとして設計されている。