एक डेवलपर ने क्वाड्रेटिक MHA बॉटलनेक्स को पार करने के लिए डिज़ाइन किए गए फ्यूज्ड ट्रिटन/CUDA स्टेट एक्कुमुलेशन कर्नेल्स वाले डिके-गेटेड O(N) कैजुअल लीनियर एटेंशन आर्किटेक्चर को ओपन-सोर्स किया है।
- कॉन्टेक्स्ट स्केलिंग: NVIDIA T4 पर <185MB VRAM के साथ 108.78ms में 128K कॉन्टेक्स्ट सीक्वेंस निष्पादित किया गया।
- कर्नेल एक्सेलरेशन: फ्यूज्ड ट्रिटन कर्नेल मानक PyTorch इम्प्लीमेंटेशन की तुलना में 3.60x स्पीडअप प्रदान करता है।
- प्रिसिजन गार्ड: लॉन्ग-कॉन्टेक्स्ट ट्रेनिंग के दौरान FP16/BF16 ग्रेडिएंट ओवरफ्लो को रोकने के लिए FP32 मास्टर एक्कुमुलेटर + RMS नॉर्मलाइजेशन का उपयोग करता है।
- रिट्रीवल एक्करेसी: 1.89x SNR के साथ 16K Needle-In-A-Haystack (NIAH) बेंचमार्क को पास किया।
लेखक मॉडल को Hugging Face Transformers में इंटीग्रेट करने या मौजूदा लीनियर मॉडल्स के साथ बेंचमार्क तुलना करने पर फीडबैक चाहता है।