El proyecto llama.cpp lanzó la compilación b11043, que incluye un cambio en la implementación de flash-attention HMX. Esta actualización habilita el soporte para dimensiones de cabeza que no son múltiplos de 64, permitiendo específicamente configuraciones como head_dim=72 de SigLIP.
- El kernel de flash-attention HMX ahora opera con DK/DV redondeados a 64 con carriles finales rellenos de ceros.
- Binarios precompilados están disponibles para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.
Este cambio permite a los usuarios ejecutar modelos con dimensiones de cabeza no estándar en hardware compatible sin problemas de compatibilidad.