يعالج FlashAttention-4 قيود الأداء في نوى التنسور ذات النقطة العائمة 4 بت (FP4) الخاصة بـ Blackwell من خلال إدخال مسارات جديدة للاستدلال غير السببي والتدريب السببي. تُعرف الطريقة باسم Direct-P، وتقوم بربط الدرجات مباشرةً باحتمالات FP4 لتجاوز أعباء تحويل softmax التي تهيمن عادةً عندما تصغر حاصل ضرب المصفوفات.
- يحقق Direct-P حتى 2.13 ضعف الإنتاجية الأمامية لـ bfloat16 (BF16) على NVIDIA GB200 للاستدلال غير السببي.
- تمر المسار السببي التكميم الأمامي مباشرةً إلى الخلفوي، مع إعادة بناء الاحتمالات من الاستعلامات والمفاتيح المكممة المحفوظة باستخدام عوامل تدرج النقطة العائمة 8 بت (FP8).
- يُسرّع هذا النهج السببي تحديثًا كاملاً لمليارَي معلمة على GPU واحد بنسبة تصل إلى 1.14x.
- يحافظ التدريب الموزع المطابق على احتمالات وقيم FP8، حيث ينحرف كل مسار تدريب للاحتمال/القيمة MXFP4 تم اختباره.
يُعتبر المؤلفون هذا الأمر مهمًا لأنه يتيح انتباه FP4 فعالًا واعٍ بالعتاد على معماريات Blackwell، متجاوزًا التبعيات التي تمنع التسريعات التلقائية من نوى تنسور FP4.