Hugging Face上的一项讨论提出,用LLM原生潜在表示替换RAG系统中的传统文本检索。该想法涉及在索引期间将文档编码为模型内部状态,并在推理时检索这些状态,从而可能绕过重新处理检索文本的成本。
- 文档被转换为LLM原生潜在表示以进行存储,而不是嵌入。
- 查询检索这些潜在状态以注入Transformer层,避免标记化和prefill成本。
- 关键挑战包括压缩表示而不丢失名称或条件等关键细节。
- 技术障碍涉及将内存注入适当的层,并将数据存储在NVMe/SSD上以实现高效加载。
- 作者正在寻找关于使用LLM内部状态作为持久外部RAG记忆的研究。
该提议旨在通过利用模型自身的语义处理能力来降低RAG prefill延迟,而不是在检索后丢弃嵌入。