Le projet llama.cpp a publié la compilation b10262, qui introduit le support de l'opération GATED_LINEAR_ATTN dans son backend Vulkan. Cette mise à jour comprend également des mises à jour de documentation pour les opérations Vulkan et supprime une constante de spécification GLA inutilisée.
- Implémentation de l'opération GATED_LINEAR_ATTN pour Vulkan (#25601)
- Mise à jour de la documentation des opérations Vulkan
- Suppression de la constante de spécification GLA inutilisée
Cette version fournit des binaires pour macOS, Linux, Windows, Android et iOS via les backends CPU, CUDA, ROCm, OpenVINO, SYCL et Vulkan.