El proyecto llama.cpp ha lanzado la versión b10982, que introduce soporte para Flash Attention disperso a través del backend de Vulkan. Esta actualización se dirige específicamente a los modelos DSV4 y GLM, permitiendo que aprovechen mecanismos de atención dispersa en hardware de GPU compatible.

  • Añade soporte de Flash Attention disperso para DSV4/GLM en la implementación de Vulkan.
  • Incluye lógica de implementación ajustada y pruebas añadidas.
  • Corrige el comportamiento no determinista de atomicAdd.
  • Añade soporte de vector de descodificación cm2 y enlace f16vec4 para vectores de descodificación.
  • Simplifica la lógica y mejora la consistencia de los nombres de variables.

El lanzamiento proporciona binarios precompilados para macOS, Linux, Windows, Android y openEuler a través de backends CPU, CUDA, ROCm, OpenVINO, SYCL y Vulkan.