FlashAttention-4 aborda las limitaciones de rendimiento de los núcleos de tensor de punto flotante de 4 bits (FP4) de Blackwell introduciendo nuevas rutas para la inferencia no causal y el entrenamiento causal. El método, llamado Direct-P, mapea las puntuaciones directamente a probabilidades FP4 para evitar los sobrecostos de conversión de softmax que suelen dominar una vez que los productos matriciales se reducen.
- Direct-P logra hasta 2,13 veces la capacidad de procesamiento hacia adelante (throughput) de bfloat16 (BF16) en un NVIDIA GB200 para inferencia no causal.
- La ruta causal pasa la cuantización hacia adelante directamente hacia atrás, reconstruyendo las probabilidades a partir de consultas y claves cuantizadas guardadas utilizando operandos de gradiente de punto flotante de 8 bits (FP8).
- Este enfoque causal acelera una actualización completa de parámetros de 8 mil millones en una sola GPU hasta en un factor de 1,14x.
- El entrenamiento distribuido emparejado conserva las probabilidades y valores FP8, ya que cada trayectoria de entrenamiento de probabilidad/valor MXFP4 probada diverge.
Los autores consideran esto importante porque permite una atención FP4 eficiente y consciente del hardware en arquitecturas Blackwell, superando las dependencias que impiden aceleraciones automáticas de los núcleos de tensor FP4.