Le projet llama.cpp a publié la version b11043, qui inclut une modification de l'implémentation de flash-attention HMX. Cette mise à jour active le support pour des dimensions de tête qui ne sont pas des multiples de 64, permettant spécifiquement des configurations comme head_dim=72 de SigLIP.
- Le noyau flash-attention HMX fonctionne désormais avec DK/DV arrondis à la hausse vers 64 avec des voies de queue remplies de zéros.
- Des binaires précompilés sont disponibles pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.
Ce changement permet aux utilisateurs d'exécuter des modèles avec des dimensions de tête non standard sur du matériel pris en charge sans problèmes de compatibilité.