Обсуждение на Hugging Face предлагает заменить традиционное извлечение текста в системах RAG на нативные латентные представления LLM. Идея заключается в кодировании документов во внутренние состояния модели во время индексации и извлечении этих состояний для вывода, что потенциально позволяет избежать затрат на повторную обработку извлеченного текста.

  • Документы преобразуются в нативные латентные представления LLM для хранения вместо эмбеддингов.
  • Запросы извлекают эти латентные состояния для внедрения в слои Transformer, избегая затрат на токенизацию и prefill.
  • Ключевые проблемы включают сжатие представлений без потери критических деталей, таких как имена или условия.
  • Технические препятствия включают внедрение памяти в соответствующие слои и хранение данных на NVMe/SSD для эффективной загрузки.
  • Автор ищет существующие исследования по использованию внутренних состояний LLM как постоянного внешнего RAG-памяти.

Предложение направлено на снижение задержки prefill RAG за счет использования собственных семантических возможностей модели, а не отбрасывания эмбеддингов после извлечения.