AI2 ने Olmo-core 3 जारी किया है, जो मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स के लिए पुनर्निर्मित ओपन ट्रेनिंग इंफ्रास्ट्रक्चर है जो कंप्यूटेशनल दक्षता बनाए रखते हुए ट्रिलियन-पैरामीटर रेंज तक स्केल करता है। फ्रेमवर्क फुली शार्डेड डेटा पैरेलेलिज्म से डिस्ट्रिब्यूटेड डेटा पैरेलेलिज्म में बदलता है, जिससे एक्सपर्ट्स GPUs पर रिजिडेंट रहते हैं और थ्रूपुट बढ़ता है तथा संचार लागत कम होती है।
- आठ NVIDIA B300 GPUs पर एक बेंचमार्क ने 47-बिलियन-पैरामीटर MoE को प्रति GPU 52,000 टोकन प्रति सेकंड दिखाया, जो पिछले इम्प्लीमेंटेशन की तुलना में 2.7x वृद्धि दर्शाता है।
- चार NVIDIA B300 GPUs पर MXFP8 प्रिसिजन सक्षम करने से ट्रेनिंग थ्रूपुट लगभग 21% बढ़ा और BF16 की तुलना में पीक एक्टिव मेमोरी 103 GiB से घटकर 95 GiB हो गई।
- सिस्टम मॉडल वेट्स और ट्रेनिंग स्टेट्स को GPU क्लस्टर पर वितरित करने के लिए एक्सपर्ट, पाइपलाइन और ऑप्टिमाइजर पैरेलेलिज्म का समर्थन करता है।
- बेंचमार्क ने 858 TFLOP/s/GPU थ्रूपुट के साथ 1.2-ट्रिलियन-पैरामीटर मॉडल तक स्केलेबिलिटी और प्रयोगात्मक कॉन्फ़िगरेशन में 2.38 ट्रिलियन पैरामीटर तक पहुंच दिखाई।
ओपन-सोर्स स्टैक अगली पीढ़ी के Olmo मॉडल्स की नींव के रूप में कार्य करता है और शोधकर्ताओं को अधिक लचीलेपन के साथ अपने स्वयं के बड़े MoE ट्रेन करने की अनुमति देता है।