FlashAttention-4 aborda las limitaciones de rendimiento de los núcleos de tensor de punto flotante de 4 bits (FP4) de Blackwell introduciendo nuevas rutas para la inferencia no causal y el entrenamiento causal. El método, llamado Direct-P, mapea las puntuaciones directamente a probabilidades FP4 para evitar los sobrecostos de conversión de softmax que suelen dominar una vez que los productos matriciales se reducen.

  • Direct-P logra hasta 2,13 veces la capacidad de procesamiento hacia adelante (throughput) de bfloat16 (BF16) en un NVIDIA GB200 para inferencia no causal.
  • La ruta causal pasa la cuantización hacia adelante directamente hacia atrás, reconstruyendo las probabilidades a partir de consultas y claves cuantizadas guardadas utilizando operandos de gradiente de punto flotante de 8 bits (FP8).
  • Este enfoque causal acelera una actualización completa de parámetros de 8 mil millones en una sola GPU hasta en un factor de 1,14x.
  • El entrenamiento distribuido emparejado conserva las probabilidades y valores FP8, ya que cada trayectoria de entrenamiento de probabilidad/valor MXFP4 probada diverge.

Los autores consideran esto importante porque permite una atención FP4 eficiente y consciente del hardware en arquitecturas Blackwell, superando las dependencias que impiden aceleraciones automáticas de los núcleos de tensor FP4.