Le projet llama.cpp a publié la compilation b10757, qui inclut une optimisation spécifique pour le backend Vulkan. Cette mise à jour gère efficacement des tailles de lot supérieures à 4 pour la multiplication matrice-vecteur IQ3_S lorsque NUM_COLS est supérieur à 4.
- Réalise une amélioration de performance de 5x à n=8 pour la configuration mat-vec IQ3_S Vulkan spécifiée.
- Ajoute deux cas par type de quantification à k=16*256 dans le balayage mat-vec all_types.
- Fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.
Cette version permet aux utilisateurs d'exécuter llama.cpp sur une grande variété de plateformes matérielles avec des optimisations Vulkan mises à jour pour des types de quantification spécifiques.