Le projet llama.cpp a publié la compilation b11362, qui introduit un nouveau noyau flash attention pour l'API tensorielle prenant en charge le stockage clé-valeur (KV) en F16. Cette mise à jour est disponible sur les plateformes macOS, Linux, Windows, Android et iOS avec diverses options de backend, notamment CUDA, Vulkan et ROCm.
- Ajoute des noyaux FA tensoriels pour des dimensions spécifiques : DK=DV=512, DK=576/DV=512 et DK=192/DV=128.
- Le nouveau noyau prend en charge les mécanismes de attention sinks, ALiBi et logit softcap.
- Des binaires précompilés sont fournis pour les backends CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0) et NPU (Snapdragon Hexagon).
Cette version permet un calcul d'attention plus efficace sur les configurations matérielles prises en charge.