Hugging Face上的一项讨论提出,用LLM原生潜在表示替换RAG系统中的传统文本检索。该想法涉及在索引期间将文档编码为模型内部状态,并在推理时检索这些状态,从而可能绕过重新处理检索文本的成本。

  • 文档被转换为LLM原生潜在表示以进行存储,而不是嵌入。
  • 查询检索这些潜在状态以注入Transformer层,避免标记化和prefill成本。
  • 关键挑战包括压缩表示而不丢失名称或条件等关键细节。
  • 技术障碍涉及将内存注入适当的层,并将数据存储在NVMe/SSD上以实现高效加载。
  • 作者正在寻找关于使用LLM内部状态作为持久外部RAG记忆的研究。

该提议旨在通过利用模型自身的语义处理能力来降低RAG prefill延迟,而不是在检索后丢弃嵌入。