FlashAttention-4 mengatasi keterbatasan kinerja inti tensor floating-point 4-bit (FP4) Blackwell dengan memperkenalkan jalur baru untuk inferensi nonkausal dan pelatihan kausal. Metode ini, yang disebut Direct-P, memetakan skor secara langsung ke probabilitas FP4 untuk melewati overhead konversi softmax yang biasanya mendominasi ketika hasil perkalian matriks mengecil.
- Direct-P mencapai throughput forward bfloat16 (BF16) hingga 2,13x pada NVIDIA GB200 untuk inferensi nonkausal.
- Jalur kausal meneruskan kuantisasi maju langsung ke mundur, merekonstruksi probabilitas dari query dan kunci terkuantisasi yang disimpan menggunakan operand gradien floating-point 8-bit (FP8).
- Pendekatan kausal ini mempercepat pembaruan parameter 8 miliar lengkap pada satu GPU hingga 1,14x.
- Pelatihan terdistribusi yang sesuai mempertahankan probabilitas dan nilai FP8, karena setiap lintasan pelatihan probabilitas/nilai MXFP4 yang diuji menyimpang.
Para penulis menganggap hal ini penting karena memungkinkan perhatian FP4 yang sadar perangkat keras secara efisien pada arsitektur Blackwell, mengatasi ketergantungan yang mencegah percepatan otomatis dari inti tensor FP4.