Le projet llama.cpp a publié la compilation b10883, qui inclut des mises à jour significatives du backend Vulkan. Le changement principal consiste à utiliser des constantes de spécification pour les opérations de multiplication matrice-matrice de type A afin d'améliorer la compilation et les performances des shaders.
- Utiliser une constante de spécification pour mul mat type_a dans les shaders Vulkan.
- Consolidation des tables de mémoire partagée et réduction de la taille par constante de spécification de type.
- Restauration de l'optimisation coopmat2 q4_k/q5_k et séparation du shader pour corriger la régression Ampere.
- Correction du type Q2_0 manquant dans la multiplication matricielle cm2 et adaptation des modifications de réglage f16 d'Intel.
- Contournement du bug du compilateur cm2 en utilisant une taille minimale de mémoire partagée de 8.
Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, GPU et matériel spécialisé.