Le projet llama.cpp a publié la version b10982, qui introduit le support de l'attention Flash sparse via le backend Vulkan. Cette mise à jour cible spécifiquement les modèles DSV4 et GLM, leur permettant d'exploiter les mécanismes d'attention sparse sur du matériel GPU compatible.
- Ajoute le support de l'attention Flash sparse pour DSV4/GLM dans l'implémentation Vulkan.
- Inclut une logique d'implémentation optimisée et des tests ajoutés.
- Corrige le comportement non déterministe de atomicAdd.
- Ajoute le support du vecteur de décodage cm2 et la liaison f16vec4 pour les vecteurs de décodage.
- Simplifie la logique et améliore la cohérence des noms de variables.
La version fournit des binaires précompilés pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, ROCm, OpenVINO, SYCL et Vulkan.