El proyecto llama.cpp lanzó la compilación b10905, que incluye un ajuste específico de Flash Attention para CUDA/HIP en la arquitectura gfx1201. Esta actualización se centra en optimizar el rendimiento para GPUs AMD RDNA4.

  • HIP: Habilita Flash Attention acelerado por multiplicación de matrices (mma) para tamaño de cabeza 256 en RDNA4 y ajusta las configuraciones asociadas.
  • HIP: Prefiere cuadrículas de Flash Attention de mosaico completo sobre stream-k en arquitecturas AMD WMMA.
  • Se revisó la lógica de stream_k para mejorar el flujo de ejecución.
  • Se revisó la lógica de selección de kernel para un mejor enfoque de hardware.

El lanzamiento proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de varios backends incluyendo CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL y OpenCL.