FlashAttention-4は、Blackwellの4ビット浮動小数点(FP4)テンソルコアのパフォーマンス制限に対処するため、非因果的推論と因果的学習のための新しいパスを導入しました。Direct-Pと呼ばれるこの手法は、行列積が縮小した際に支配的になるソフトマックス変換のオーバーヘッドを回避するために、スコアを直接FP4確率にマッピングします。
- Direct-Pは、NVIDIA GB200上で非因果的推論においてbfloat16(BF16)の順伝播スループットを最大2.13倍達成します。
- 因果的パスは、前方量子化を後方に直接渡し、保存された量子化クエリとキーから8ビット浮動小数点(FP8)勾配演算子を使用して確率を再構築します。
- この因果的手法により、単一GPUでの80億パラメータの完全な更新が最大1.14倍高速化されます。
- 一致した分散学習ではFP8確率と値を保持し、テストされたすべてのMXFP4確率/値学習軌道が発散するためです。
著者らはこれが重要であると考えます。なぜなら、これはBlackwellアーキテクチャ上で効率的なハードウェア対応FP4アテンションを可能にし、FP4テンソルコアからの自動高速化を防ぐ依存関係を克服するからです。