Le projet llama.cpp a publié la compilation b10905, qui inclut un ajustement spécifique de Flash Attention pour CUDA/HIP sur l'architecture gfx1201. Cette mise à jour se concentre sur l'optimisation des performances pour les GPU AMD RDNA4.

  • HIP : Active Flash Attention accéléré par multiplication matricielle (mma) pour une taille de tête de 256 sur RDNA4 et ajuste les configurations associées.
  • HIP : Privilégie les grilles de Flash Attention en tuile complète plutôt que stream-k sur les architectures AMD WMMA.
  • La logique de stream_k a été révisée pour améliorer le flux d'exécution.
  • La logique de sélection de noyau a été révisée pour une meilleure ciblage matériel.

La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via divers backends incluant CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL et OpenCL.