Hugging Face पर एक चर्चा RAG सिस्टम में पारंपरिक टेक्स्ट पुनः प्राप्ति को LLM-नेटिव लैटेंट प्रतिनिधित्वों से बदलने का सुझाव देती है। इस विचार में इंडेक्सिंग के दौरान दस्तावेजों को आंतरिक मॉडल अवस्थाओं में एन्कोड करना और इनफरेंस के लिए उन अवस्थाओं को पुनः प्राप्त करना शामिल है, जिससे पुनः प्राप्त टेक्स्ट को फिर से प्रोसेस करने की लागत से बचा जा सकता है।
- दस्तावेजों को एम्बेडिंग्स के बजाय भंडारण के लिए LLM-नेटिव लैटेंट प्रतिनिधित्वों में परिवर्तित किया जाता है।
- क्वेरीं इन लैटेंट अवस्थाओं को पुनः प्राप्त करती हैं ताकि उन्हें Transformer परतों में इंजेक्ट किया जा सके, जिससे टोकनाइज़ेशन और prefill लागत से बचा जा सके।
- प्रमुख चुनौतियों में नाम या शर्तों जैसे महत्वपूर्ण विवरण खोए बिना प्रतिनिधित्वों को संकुचित करना शामिल है।
- तकनीकी बाधाओं में उचित परतों में मेमोरी इंजेक्ट करना और कुशल लोडिंग के लिए NVMe/SSD पर डेटा संग्रहित करना शामिल है।
- लेखक LLM की आंतरिक अवस्थाओं को स्थिर बाह्य RAG मेमोरी के रूप में उपयोग करने पर मौजूदा शोध खोज रहा है।
यह प्रस्ताव RAG prefill विलंबता को कम करने का लक्षित रखता है, पुनः प्राप्ति के बाद एम्बेडिंग्स को फेंकने के बजाय मॉडल की अपनी अर्थपूर्ण प्रोसेसिंग क्षमताओं का लाभ उठाकर।