Together AI के कर्नेल टीम ने NVIDIA Vera Rubin NVL72 प्लेटफ़ॉर्म में नई सुविधाओं का लाभ उठाने के लिए ThunderKittens लाइब्रेरी को अनुकूलित किया है, विशेष रूप से NVFP4 और FP8 मैट्रिक्स गुणन के लिए बेहतर प्रदर्शन पर केंद्रित।
- Vera Rubin टेंसर कोर 32 बाइट्स की तुलना में 64 बाइट्स के K स्टेप के साथ ऑपरैंड्स को दोगुनी गति से खपत करते हैं।
- टेंसर मेमोरी बढ़कर 576 कॉलम हो गई है, जिससे .exclusive क्वालिफ़ायर के माध्यम से अतिरिक्त 32 KiB सुलभ होता है।
- शेयर्ड मेमोरी गतिशील रूप से 328 KiB तक विस्तारित होती है, और एक B-साइड कलेक्टर बफ़र ऑपरैंड पुन: उपयोग की अनुमति देता है।
- tcgen05.commit.sync_restrict निर्देश A टाइल्स को शीघ्र मुक्त करने की सुविधा देता है ताकि लोड और कंप्यूटेशन अलग हो सकें।
- इन सुविधाओं को एकीकृत करने से NVFP4 प्रदर्शन 22 PFLOPS से अधिक हो जाता है, जो cuBLAS और CuTE DSL के बराबर है।
ये अनुकूलन उस बाउलनेक को दूर करते हैं जहां टेंसर कोर डेटा को पिछले Blackwell कर्नेल्स की तुलना में तेजी से खपत करते हैं, जिससे नई आर्किटेक्चर पर प्रतिस्पर्धात्मक थ्रूपुट संभव होता है।