Le projet llama.cpp a publié la version b11035, introduisant le support des noyaux de multiplication matricielle IQ3_S MMQ dans son backend Vulkan.
- La mise à jour inclut de nouveaux noyaux IQ3_S MMQ matmul pour Vulkan.
- Block_a_to_shmem effectue désormais des chargements de 2 octets pour optimiser l'accès à la mémoire.
- Les vérifications d'alignement ont été ajustées car IQ3_S utilise la taille du tile K.
- Les binaires sont disponibles pour macOS, Linux, Windows, Android et openEuler sur les plateformes CPU, CUDA, ROCm, OpenVINO, SYCL et OpenCL.
Cette version fournit des binaires mis à jour pour divers systèmes d'exploitation et accélérateurs matériels, permettant aux utilisateurs de tirer parti du nouveau support de quantification Vulkan.