O projeto llama.cpp lançou a compilação b10905, que inclui um ajuste específico do Flash Attention para CUDA/HIP na arquitetura gfx1201. Esta atualização foca em otimizar o desempenho para GPUs AMD RDNA4.

  • HIP: Habilita Flash Attention acelerado por multiplicação de matrizes (mma) para tamanho de cabeça 256 no RDNA4 e ajusta as configurações associadas.
  • HIP: Prefere grades de Flash Attention de tile completo sobre stream-k em arquiteturas AMD WMMA.
  • Revisada a lógica do stream_k para melhorar o fluxo de execução.
  • Revisada a lógica de seleção de kernel para melhor direcionamento de hardware.

O lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de vários backends incluindo CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL e OpenCL.