Le projet llama.cpp a publié la compilation b10262, qui introduit le support de l'opération GATED_LINEAR_ATTN dans son backend Vulkan. Cette mise à jour comprend également des mises à jour de documentation pour les opérations Vulkan et supprime une constante de spécification GLA inutilisée.

  • Implémentation de l'opération GATED_LINEAR_ATTN pour Vulkan (#25601)
  • Mise à jour de la documentation des opérations Vulkan
  • Suppression de la constante de spécification GLA inutilisée

Cette version fournit des binaires pour macOS, Linux, Windows, Android et iOS via les backends CPU, CUDA, ROCm, OpenVINO, SYCL et Vulkan.