تقترح مناقشة على Hugging Face استبدال الاسترجاع التقليدي للنظام في أنظمة RAG بالتمثيلات الكامنة الأصلية لـ LLM. تتضمن الفكرة ترميز المستندات إلى حالات النموذج الداخلية أثناء الفهرسة واسترجاع تلك الحالات للاستدلال، مما قد يتجاوز تكلفة إعادة معالجة النص المسترجع.

  • يتم تحويل المستندات إلى تمثيلات كامنة أصلية لـ LLM للتخزين بدلاً من التضمينات.
  • تسترجع الاستعلامات هذه الحالات الكامنة لحقنها في طبقات Transformer، متجنبةً تكاليف الترميز المرحلي وتكاليف prefill.
  • تشمل التحديات الرئيسية ضغط التمثيلات دون فقدان التفاصيل الحاسمة مثل الأسماء أو الشروط.
  • تتضمن العقبات التقنية حقن الذاكرة في الطبقات المناسبة وتخزين البيانات على NVMe/SSD للتحميل الفعال.
  • يبحث المؤلف عن أبحاث موجودة حول استخدام الحالات الداخلية لـ LLM كذاكرة RAG خارجية دائمة.

يهدف الاقتراح إلى تقليل زمن استجابة prefill في RAG من خلال الاستفادة من قدرات المعالجة الدلالية الخاصة بالنموذج بدلاً من التخلي عن التضمينات بعد الاسترجاع.