Hugging Face에서의 논의는 RAG 시스템의 기존 텍스트 검색을 LLM 네이티브 잠재 표현으로 대체할 것을 제안합니다. 이 아이디어는 인덱싱 중에 문서를 모델 내부 상태로 인코딩하고 추론을 위해 해당 상태를 검색하여 검색된 텍스트를 다시 처리하는 비용을 우회할 수 있습니다.

  • 문서는 임베딩 대신 저장용 LLM 네이티브 잠재 표현으로 변환됩니다.
  • 쿼리는 이러한 잠재 상태를 검색하여 Transformer 레이어에 주입하여 토큰화 및 prefill 비용을 피합니다.
  • 주요 과제는 이름이나 조건과 같은 중요한 세부 정보를 잃지 않고 표현을 압축하는 것입니다.
  • 기술적 장벽에는 적절한 레이어에 메모리를 주입하고 효율적인 로딩을 위해 NVMe/SSD에 데이터를 저장하는 것이 포함됩니다.
  • 저자는 LLM 내부 상태를 영구 외부 RAG 메모리로 사용하는 기존 연구를 찾고 있습니다.

이 제안은 임베딩을 검색 후 버리는 대신 모델 자체의 의미 처리 능력을 활용하여 RAG prefill 지연 시간을 줄이는 것을 목표로 합니다.