Une discussion sur Hugging Face propose de remplacer la récupération traditionnelle de texte dans les systèmes RAG par des représentations latentes natives du LLM. L'idée consiste à encoder les documents dans les états internes du modèle lors de l'indexation et à récupérer ces états pour l'inférence, potentiellement en contournant le coût de retraitement du texte récupéré.
- Les documents sont convertis en représentations latentes natives du LLM pour le stockage au lieu des embeddings.
- Les requêtes récupèrent ces états latents pour les injecter dans les couches du Transformer, évitant les coûts de tokenisation et de prefill.
- Les défis clés incluent la compression des représentations sans perdre de détails critiques comme les noms ou les conditions.
- Les obstacles techniques impliquent l'injection de mémoire dans les couches appropriées et le stockage des données sur NVMe/SSD pour un chargement efficace.
- L'auteur cherche des recherches existantes sur l'utilisation des états internes du LLM comme mémoire RAG externe persistante.
La proposition vise à réduire la latence de prefill du RAG en exploitant les capacités de traitement sémantique du modèle lui-même plutôt que de jeter les embeddings après la récupération.