El proyecto llama.cpp lanzó la compilación b10905, que incluye un ajuste específico de Flash Attention para CUDA/HIP en la arquitectura gfx1201. Esta actualización se centra en optimizar el rendimiento para GPUs AMD RDNA4.
- HIP: Habilita Flash Attention acelerado por multiplicación de matrices (mma) para tamaño de cabeza 256 en RDNA4 y ajusta las configuraciones asociadas.
- HIP: Prefiere cuadrículas de Flash Attention de mosaico completo sobre stream-k en arquitecturas AMD WMMA.
- Se revisó la lógica de stream_k para mejorar el flujo de ejecución.
- Se revisó la lógica de selección de kernel para un mejor enfoque de hardware.
El lanzamiento proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de varios backends incluyendo CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL y OpenCL.