Le projet llama.cpp a publié la version b10456, qui inclut une correction critique pour le backend SYCL dans les lancements de noyaux de copie quantifiés. La mise à jour ajuste les nombres de threads et de blocs pour qu'ils soient proportionnels à la taille de la quantification, réduisant ainsi efficacement les problèmes de sous- et sur-allocation.

  • Correction du nombre de threads/blocs dans les lancements de noyaux cpy quantifiés (PR #27160).
  • Le débit pour le chemin q4_0 -> f32 sur un Arc 70 augmente de 20,21 Go/s à 158,19 Go/s.
  • Les autres chemins de quantification montrent des améliorations de performance constantes.
  • Les binaires sont disponibles pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, Vulkan, ROCm, OpenVINO et SYCL.

Cette amélioration augmente considérablement l'efficacité du transfert de données sur les GPU Intel Arc utilisant le backend SYCL, en adressant un goulot d'étranglement majeur des performances dans les opérations quantifiées.