शोधकर्ताओं ने Reduced Matrix Multiplication (RMM) का प्रस्ताव रखा है, जो एक ट्रेनिंग-फ्री, इनपुट-अनुकूलित निष्पादन विधि है जो मॉडल वजन को संशोधित किए बिना संकुचन आयामों के साथ सूचनात्मक स्लाइस का चयन करके ट्रान्सफॉर्मर मैट्रिक्स गुणनों को कम करती है। एक सरल रिटेंशन-अनुपात नियंत्रण के तहत, RMM 1B से 70B पैरामीटर तक के भाषा मॉडलों में सटीकता-दक्षता का एक सहज और पूर्वानुमेय व्यापार प्रदान करता है।

  • कमी सहनशीलता मॉडल परिवार, कार्य, घटक और रिटेंशन अनुपात पर निर्भर करती है, जो अक्सर मॉडल स्केल के साथ सुधार होती है।
  • RMM माध्यम कमी के तहत विभेदक, ऑटोरेग्रेसिव जनरेशन और लंबे-संदर्भ सेटिंग्स में मजबूत बना रहता है।
  • यह सिद्धांत बहुमोडल विजन-लैंग्वेज निष्पादन तक फैलता है।
  • मैकेनिस्टिक एब्लेशन दर्शाते हैं कि एटेंशन-साइड की गणनाएं MLP घटकों की तुलना में काफी अधिक कमी योग्य हैं।
  • NVIDIA A100 पर वॉल-क्लॉक बेंचमार्क व्यावहारिक रनटाइम लाभ दिखाते हैं, विशेष रूप से लंबे अनुक्रम लंबाई पर।

ये परिणाम RMM को इनपुट-अनुकूलित निष्पादन-समय अनुकूलन के लिए एक स्केलेबल दिशा के रूप में स्थित करते हैं।