FlashAttention-4 नॉनकॉजुअल इनफरेंस और काज़ुअल ट्रेनिंग के लिए नए मार्गों को पेश करके Blackwell के 4-बिट फ्लोटिंग-पॉइंट (FP4) टेन्सर कोर्स की प्रदर्शन सीमाओं को दूर करता है। Direct-P नामक यह विधि स्कोर को सीधे FP4 प्रायिकताओं में मैप करती है, ताकि सॉफ्टमैक्स रूपांतरण ओवरहेड से बचा जा सके जो आमतौर पर मैट्रिक्स गुणा छोटे होने पर प्रमुख हो जाते हैं।

  • Direct-P नॉनकॉजुअल इनफरेंस के लिए NVIDIA GB200 पर bfloat16 (BF16) फॉरवर्ड थ्रूपुट में 2.13x तक की वृद्धि हासिल करता है।
  • काज़ुअल मार्ग फॉरवर्ड क्वांटीज़ेशन को सीधे बैकवर्ड में पास करता है, जहाँ 8-बिट फ्लोटिंग-पॉइंट (FP8) ग्रेडिएंड ऑपरेंड्स का उपयोग करके सेव्ड क्वांटाइज्ड क्वेरीज़ और कीज़ से प्रायिकताओं को पुनर्निर्मित किया जाता है।
  • यह काज़ुअल दृष्टिकोण एक पूर्ण सिंगल-GPU 8-बिलियन-पैरामीटर अपडेट में 1.14x तक की गति प्राप्त करता है।
  • मैच्ड डिस्ट्रीब्यूटेड ट्रेनिंग FP8 प्रायिकताओं और वैल्यूज़ को बनाए रखती है, क्योंकि प्रत्येक परीक्षित MXFP4 प्रायिकता/वैल्यू ट्रेनिंग ट्रैजेक्टरी विचलित हो जाती है।

लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि यह Blackwell आर्किटेक्चर पर हार्डवेयर-अware FP4 एटेंशन को कुशलता से सक्षम बनाता है, जो FP4 टेन्सर कोर्स से स्वचालित स्पीडअप को रोकने वाली निर्भरताओं को दूर करता है।