Le projet llama.cpp a publié la compilation b10777, qui inclut des optimisations pour le backend SYCL de la multiplication matrice-vecteur (MMVQ) à colonnes multiples avec Q4_K. La mise à jour se concentre sur la réduction du travail computationnel redondant grâce à des stratégies de dépaquetage des poids et de réutilisation des activations.

  • Optimise le dépaquetage des poids Q4_K et réutilise les données entre les colonnes de destination.
  • Implémente la réutilisation de sous-groupes d'activations pour de petites valeurs de N (N=2..4) sur deux lignes de sortie.
  • Limite le schéma de réutilisation de deux lignes spécifiquement à N=2 pour améliorer l'efficacité.
  • Met à jour le seuil du nombre magique à Q4_K_MMVQ_ROW_PAIR_MIN_NROWS=6272 et ajoute des tests de performance pour la couverture MUL_MAT avec Q4_K.

Cette version fournit des binaires précompilés pour macOS, Linux, Android, Windows et openEuler sur divers backends matériels, y compris CPU, CUDA, ROCm, Vulkan, OpenVINO et SYCL.