Una discusión en Hugging Face propone reemplazar la recuperación tradicional de texto en sistemas RAG con representaciones latentes nativas de LLM. La idea implica codificar documentos en estados internos del modelo durante la indexación y recuperar esos estados para inferencia, potencialmente evitando el costo de volver a procesar el texto recuperado.

  • Los documentos se convierten en representaciones latentes nativas de LLM para almacenamiento en lugar de embeddings.
  • Las consultas recuperan estos estados latentes para inyectarlos en las capas del Transformer, evitando los costos de tokenización y prefill.
  • Los desafíos clave incluyen comprimir las representaciones sin perder detalles críticos como nombres o condiciones.
  • Los obstáculos técnicos implican inyectar memoria en las capas apropiadas y almacenar datos en NVMe/SSD para una carga eficiente.
  • El autor busca investigación existente sobre el uso de estados internos de LLM como memoria RAG externa persistente.

La propuesta tiene como objetivo reducir la latencia de prefill de RAG aprovechando las capacidades de procesamiento semántico del propio modelo en lugar de descartar los embeddings después de la recuperación.