Обсуждение на Hugging Face предлагает заменить традиционное извлечение текста в системах RAG на нативные латентные представления LLM. Идея заключается в кодировании документов во внутренние состояния модели во время индексации и извлечении этих состояний для вывода, что потенциально позволяет избежать затрат на повторную обработку извлеченного текста.
- Документы преобразуются в нативные латентные представления LLM для хранения вместо эмбеддингов.
- Запросы извлекают эти латентные состояния для внедрения в слои Transformer, избегая затрат на токенизацию и prefill.
- Ключевые проблемы включают сжатие представлений без потери критических деталей, таких как имена или условия.
- Технические препятствия включают внедрение памяти в соответствующие слои и хранение данных на NVMe/SSD для эффективной загрузки.
- Автор ищет существующие исследования по использованию внутренних состояний LLM как постоянного внешнего RAG-памяти.
Предложение направлено на снижение задержки prefill RAG за счет использования собственных семантических возможностей модели, а не отбрасывания эмбеддингов после извлечения.