Le projet llama.cpp a publié la version b11460, qui introduit le support du format de quantification IQ3_S multi-column MMVQ dans son backend SYCL. Cette mise à jour est incluse dans la nouvelle compilation aux côtés des options standard d'accélération CPU et GPU.
- La release ajoute le support IQ3_S multi-column MMVQ à l'implémentation de SYCL via la pull request #29500.
- Des binaires sont fournis pour macOS (Apple Silicon et Intel), Linux (x64, arm64, s390x), Windows, Android et openEuler.
- L'accélération GPU est disponible via CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO et OpenCL Adreno sur les plateformes prises en charge.
- Des builds spécifiques sont inclus pour les appareils Snapdragon sous Linux et Android, prenant en charge le CPU, le GPU Adreno et le NPU Hexagon.
Cette release permet aux utilisateurs d'accéder aux dernières optimisations SYCL et élargit la compatibilité matérielle pour exécuter des modèles llama.cpp sur diverses architectures.