Le projet llama.cpp a publié la compilation b10714, qui inclut des optimisations spécifiques pour le backend Vulkan ciblant le matériel AMD Strix Halo. La mise à jour ajuste les compteurs de lignes de multiplication matrice-vecteur pour améliorer les performances lors de l'inférence par lots.
- Vulkan : Définit 4 lignes statiques pour les opérations mat-vec sur les architectures RDNA3 avec plus de quatre colonnes, car cette configuration obtient de meilleurs résultats aux benchmarks que la valeur par défaut.
- Vulkan : Applique un réglage statique de 4 lignes pour mul_mat_vec_id sur les machines Strix Halo, s'avérant plus rapide sur divers types et tailles de lots par rapport aux valeurs par défaut.
Ces modifications apportent des gains de performances tangibles aux utilisateurs exécutant llama.cpp sur des GPU basés sur RDNA3 comme Strix Halo.