Le projet llama.cpp a publié la version b10702, qui inclut une optimisation spécifique pour le chemin du produit scalaire de quantification Q2_0 sur l'architecture gfx1201 d'AMD. Cette mise à jour étend l'implémentation de HIP pour utiliser des instructions natives de permutation amdgcn, améliorant les performances pour cette configuration matérielle spécifique.
- Optimise `vec_dot_q2_0_q8_1` avec la permutation amdgcn native pour gfx1201.
- Étend l'optimisation de permutation Q2_0 de HIP et supprime les gardes de disponibilité redondants.
- Optimise le dépaquetage MMQ Q2_0 de HIP en utilisant des instructions de permutation natives.
- Restaure la gestion de l'index de tuile MMQ et étiquette les gardes du préprocesseur HIP dans le code CUDA.
Cette version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via CPU, GPU (CUDA, ROCm, Vulkan, OpenCL) et backends spécialisés comme OpenVINO et SYCL.