Le projet llama.cpp a publié la version b10203, qui introduit le support du format de quantification q2_0 dans les opérations de multiplication de matrices basées sur SYCL. Cette mise à jour étend la compatibilité de la bibliothèque pour des scénarios spécifiques d'accélération matérielle.

  • Ajoute le support de q2_0 dans mul_mat via la PR #26231.
  • Étend la couverture aux cas supplémentaires de q2_0 au sein du backend SYCL.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) et openEuler.

La publication permet aux utilisateurs d'utiliser la quantification q2_0 sur des appareils compatibles SYCL, élargissant ainsi la gamme des configurations matérielles prises en charge pour une inférence de modèle efficace.