Le projet llama.cpp a publié la compilation b10871, introduisant un shader mul_mat_vec_iq4_xs dédié pour le chemin dmmv dans Vulkan. Ce changement remplace l'implémentation de repli générique précédente pour améliorer les performances sur le matériel RDNA4.
- Le nouveau shader offre une génération de tokens environ 6 à 17 % plus rapide selon le modèle utilisé.
- Une branche expérimentale tentant de dérouler complètement la boucle du bloc pour n_it <= 8 a été supprimée car elle était fonctionnellement équivalente à la boucle simple conservée dans le code.
- Les binaires sont disponibles pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, ROCm, OpenVINO, SYCL et Vulkan.