O FlashAttention-4 aborda as limitações de desempenho dos núcleos de tensores de ponto flutuante de 4 bits (FP4) do Blackwell, introduzindo novos caminhos para inferência não causal e treinamento causal. O método, chamado Direct-P, mapeia escores diretamente para probabilidades FP4 para contornar os custos de conversão de softmax que normalmente dominam quando os produtos matriciais diminuem.

  • O Direct-P alcança até 2,13 vezes a taxa de transferência direta (throughput) de bfloat16 (BF16 em um NVIDIA GB200 para inferência não causal.
  • O caminho causal passa a quantização direta para o backward, reconstruindo probabilidades a partir de consultas e chaves quantizadas salvas usando operandos de gradiente de ponto flutuante de 8 bits (FP8).
  • Essa abordagem causal acelera uma atualização completa de parâmetros de 8 bilhões em uma única GPU em até 1,14x.
  • O treinamento distribuído correspondente mantém probabilidades e valores FP8, pois toda trajetória de treinamento de probabilidade/valor MXFP4 testada diverge.

Os autores consideram isso importante porque permite atenção FP4 eficiente com consciência de hardware nas arquiteturas Blackwell, superando as dependências que impedem aceleradores automáticos dos núcleos de tensores FP4.