शोधकर्ताओं ने स्केवएडम पेश किया, जो मिक्चर-ऑफ-एक्सपर्ट्स (MoE) मॉडलों के लिए डिज़ाइन किया गया एक ऑप्टिमाइजर है जो अलग-अलग पैरामीटर आबादी को अलग-अलग स्टेट प्रकार आवंटित करके मेमोरी उपयोग को काफी कम करता है। बैकबोन के लिए float32 मोमेंटम और फैक्टरized सेकंड मोमेंट्स, एक्सपर्ट्स के लिए फैक्टरized सेकंड मोमेंट्स, और राउटर के लिए एक्सेक्ट सेकंड मोमेंट्स आवंटित करके, स्केवएडम 6.78B-पैरामीटर मॉडल के लिए ऑप्टिमाइजर स्टेट को 50.6 GB से 1.29 GB तक कम करता है।
- शीर्ष प्रशिक्षण मेमोरी 81.4 GB से घटकर 31.3 GB हो जाती है, जो 40 GB एक्सेलेरेटर बजट के भीतर फिट होती है।
- स्केवएडम 82M टोकन पर 108.4 का वैलिडेशन परप्लेक्सिटी हासिल करता है, जो AdamW (126.8), Muon (120.2), और Lion (393.7) से बेहतर प्रदर्शन करता है।
- मेमोरी की बचत सटीकता के नुकसान के बिना हासिल की गई है; प्रदर्शन लाभ मोमेंटम को बनाए रखने से आता है, न कि टियर्ड आवंटन से ही।
परिणाम सुझाव देते हैं कि ऑप्टिमाइजर स्टेट कहाँ आवंटित किया जाता है, उसका महत्व उसके आयतन के बराबर है, जिससे सीमित मेमोरी वाले हार्डवेयर पर कुशल प्रशिक्षण संभव होता है।