Uma discussão no Hugging Face propõe substituir a recuperação tradicional de texto em sistemas RAG por representações latentes nativas de LLM. A ideia envolve codificar documentos nos estados internos do modelo durante a indexação e recuperar esses estados para inferência, potencialmente contornando o custo de reprocessar o texto recuperado.
- Documentos são convertidos em representações latentes nativas de LLM para armazenamento em vez de embeddings.
- Consultas recuperam esses estados latentes para injetar nas camadas do Transformer, evitando custos de tokenização e prefill.
- Os principais desafios incluem comprimir as representações sem perder detalhes críticos como nomes ou condições.
- Obstáculos técnicos envolvem injetar memória nas camadas apropriadas e armazenar dados em NVMe/SSD para carregamento eficiente.
- O autor busca pesquisas existentes sobre o uso de estados internos do LLM como memória RAG externa persistente.
A proposta visa reduzir a latência de prefill do RAG aproveitando as capacidades de processamento semântico do próprio modelo, em vez de descartar os embeddings após a recuperação.