Le projet llama.cpp a publié la version b10891, qui résout un problème critique de stabilité sur les GPU PowerVR. La mise à jour modifie le backend Vulkan pour qu'il recoure à la réduction par mémoire partagée pour les opérations de multiplication matrice-vecteur déquantifiée (dmmv).
- Le changement résout un crash causé par le compilateur Vulkan propriétaire d'Imagination qui renvoyait VK_ERROR_UNKNOWN lors de la construction de pipelines de calcul avec des réductions uniquement au niveau des sous-groupes.
- Cette correction s'applique aux formats de quantification k-quants, i-quants, TQ2_0, MXFP4 et NVFP4 qui échouaient précédemment sur des appareils comme le Pixel 11 Pro.
- La variante de réduction par mémoire partagée se compile avec succès et correspond aux résultats de référence CPU pour les quantifications q2_K à q6_K.
- Une variante hybride est également disponible mais entraîne une pénalité de performance significative, réduisant le débit de tokens à 27 % du taux standard.
Cette mise à jour garantit que les modèles utilisant ces formats de quantification spécifiques peuvent s'exécuter sur du matériel PowerVR sans planter lors de la phase initiale de génération de tokens.