Uma discussão no Hugging Face propõe substituir a recuperação tradicional de texto em sistemas RAG por representações latentes nativas de LLM. A ideia envolve codificar documentos nos estados internos do modelo durante a indexação e recuperar esses estados para inferência, potencialmente contornando o custo de reprocessar o texto recuperado.

  • Documentos são convertidos em representações latentes nativas de LLM para armazenamento em vez de embeddings.
  • Consultas recuperam esses estados latentes para injetar nas camadas do Transformer, evitando custos de tokenização e prefill.
  • Os principais desafios incluem comprimir as representações sem perder detalhes críticos como nomes ou condições.
  • Obstáculos técnicos envolvem injetar memória nas camadas apropriadas e armazenar dados em NVMe/SSD para carregamento eficiente.
  • O autor busca pesquisas existentes sobre o uso de estados internos do LLM como memória RAG externa persistente.

A proposta visa reduzir a latência de prefill do RAG aproveitando as capacidades de processamento semântico do próprio modelo, em vez de descartar os embeddings após a recuperação.