Sebuah diskusi di Hugging Face mengusulkan mengganti pengambilan teks tradisional dalam sistem RAG dengan representasi laten asli LLM. Gagasan ini melibatkan pengkodean dokumen ke dalam keadaan internal model selama pengindeksan dan mengambil keadaan tersebut untuk inferensi, berpotensi menghindari biaya memproses ulang teks yang diambil.
- Dokumen diubah menjadi representasi laten asli LLM untuk penyimpanan alih-alih embedding.
- Kueri mengambil keadaan laten ini untuk disuntikkan ke lapisan Transformer, menghindari biaya tokenisasi dan prefill.
- Tantangan utama termasuk mengompresi representasi tanpa kehilangan detail kritis seperti nama atau kondisi.
- Hambatan teknis melibatkan penyuntikan memori ke lapisan yang sesuai dan penyimpanan data di NVMe/SSD untuk pemuatan yang efisien.
- Penulis mencari penelitian yang ada tentang penggunaan keadaan internal LLM sebagai memori RAG eksternal yang persisten.
Proposal ini bertujuan mengurangi latensi prefill RAG dengan memanfaatkan kemampuan pemrosesan semantik model itu sendiri, bukan membuang embedding setelah pengambilan.