يقترح الباحثون طريقة استدعاء تكيفية مع الإدخال وخالية من التدريب تُسمى تقليل ضرب المصفوفات (RMM)، والتي تقلل حاصل ضرب مصفوفات المحولات عن طريق اختيار شرائح ذات معلوماتية عالية على طول أبعاد الانكماش دون تعديل أوزان النموذج. تحت تحكم بسيط بنسبة الاحتفاظ، يوفر RMM مقايضة سلسة ومتوقعة بين الدقة والكفاءة عبر نماذج لغوية تتراوح من 1 مليار إلى 70 مليار معامل.
- تعتمد تسامح الاختزال على عائلة النموذج والمهمة والمكون ونسبة الاحتفاظ، وغالباً ما يتحسن مع زيادة حجم النموذج.
- يبقى RMM متيناً عبر الإعدادات التمييزية، والتوليد الذاتي المرجعي، والسياقات طويلة المدى تحت اختزال معتدل.
- تمتد المبدأ إلى استدعاء الرؤية واللغة متعدد الوسائط.
- تكشف الاختزالات الآلية عن أن الحسابات الجانبية للانتباه قابلة للاختزال بشكل كبير أكثر من مكونات MLP.
- تظهر معايير الوقت الفعلي على NVIDIA A100 مكاسب عملية في وقت التشغيل، خاصة عند أطوال تسلسل أطول.
تضع هذه النتائج RMM كاتجاه قابل للتوسع لتحسين وقت الاستدعاء المتكيف مع الإدخال.