El proyecto llama.cpp ha lanzado la versión b10982, que introduce soporte para Flash Attention disperso a través del backend de Vulkan. Esta actualización se dirige específicamente a los modelos DSV4 y GLM, permitiendo que aprovechen mecanismos de atención dispersa en hardware de GPU compatible.
- Añade soporte de Flash Attention disperso para DSV4/GLM en la implementación de Vulkan.
- Incluye lógica de implementación ajustada y pruebas añadidas.
- Corrige el comportamiento no determinista de atomicAdd.
- Añade soporte de vector de descodificación cm2 y enlace f16vec4 para vectores de descodificación.
- Simplifica la lógica y mejora la consistencia de los nombres de variables.
El lanzamiento proporciona binarios precompilados para macOS, Linux, Windows, Android y openEuler a través de backends CPU, CUDA, ROCm, OpenVINO, SYCL y Vulkan.