Hugging Faceでの議論は、RAGシステムにおける従来のテキスト検索をLLMネイティブな潜在表現に置き換えることを提案しています。このアイデアは、インデックス作成中に文書をモデル内部の状態にエンコードし、推論時にそれらの状態を取得することで、取得されたテキストの再処理コストを回避する可能性があります。
- 文書は埋め込みの代わりに保存用にLLMネイティブな潜在表現に変換されます。
- クエリはこれらの潜在状態を取得してTransformer層に注入し、トークン化とprefillのコストを回避します。
- 主な課題には、名前や条件などの重要な詳細を失うことなく表現を圧縮することが含まれます。
- 技術的な障壁には、適切な層にメモリを注入し、効率的な読み込みのためにデータをNVMe/SSDに保存することが含まれます。
- 著者は、LLM内部の状態を永続的な外部RAGメモリとして使用することに関する既存の研究を探しています。
この提案は、埋め込みを取得後に破棄するのではなく、モデル自体のセマンティック処理能力を活用してRAG prefillレイテンシを削減することを目的としています。