Le projet llama.cpp a publié la compilation b10883, qui inclut des mises à jour significatives du backend Vulkan. Le changement principal consiste à utiliser des constantes de spécification pour les opérations de multiplication matrice-matrice de type A afin d'améliorer la compilation et les performances des shaders.

  • Utiliser une constante de spécification pour mul mat type_a dans les shaders Vulkan.
  • Consolidation des tables de mémoire partagée et réduction de la taille par constante de spécification de type.
  • Restauration de l'optimisation coopmat2 q4_k/q5_k et séparation du shader pour corriger la régression Ampere.
  • Correction du type Q2_0 manquant dans la multiplication matricielle cm2 et adaptation des modifications de réglage f16 d'Intel.
  • Contournement du bug du compilateur cm2 en utilisant une taille minimale de mémoire partagée de 8.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, GPU et matériel spécialisé.