Le projet llama.cpp a publié la version b11160, introduisant une implémentation de matrice coopérative int8 (coopmat1) pour Vulkan sur les architectures AMD RDNA3 et RDNA4. Cette mise à jour inclut un shader dédié qui sonde directement les valeurs coopmat pour améliorer les performances.
- Ajoute le support de la quantification IQ4_XS au shader de matmul entier mul_mmq_cm1.
- Implémente l'application d'échelle inline, les sommes scalaires et le double buffering pour le backend Vulkan.
- Prend en charge les quantifications q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k et nvfp4.
- Inclut des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, ROCm, OpenVINO et SYCL.