قام مطوّر بنشر بنية الانتباه الخطي السببي O(N) ذو العتبة التدهورية كمصدر مفتوح، وتتضمّن نوى تراكم حالة مدمجة من Triton/CUDA مصمّمة لتجاوز الاختناقات التربيعية في الانتباه متعدد الرؤوس (MHA).
- توسيع السياق: تنفيذ تسلسل سياق بطول 128K في 108.78 مللي ثانية مع استهلاك أقل من 185MB من ذاكرة الفيديو على NVIDIA T4.
- تسريع النواة: تقدّم نواة Triton المدمجة تسارعاً بنسبة 3.60x مقارنةً بالتنفيذ القياسي لـ PyTorch.
- حماية الدقة: تستخدم تراكم رئيسي بـ FP32 + تطبيع RMS لمنع تجاوز تدرجات FP16/BF16 أثناء التدريب على سياقات طويلة.
- دقة الاسترجاع: اجتاز معيار Needle-In-A-Haystack (NIAH) بطول 16K بنسبة إشارة إلى ضجيج (SNR) تبلغ 1.89x.
يبحث المؤلف عن ملاحظات حول دمج النموذج في Hugging Face Transformers أو إجراء مقارنات معايير أداء مع النماذج الخطية الموجودة.