Le projet llama.cpp a publié la version b11122, qui comprend des mises à jour significatives pour le backend SYCL. La release étend la fusion MMVQ GLU pour prendre en charge les types de quantification mixtes et introduit de nouvelles fusions pour les opérations rms_norm+scale et ssm_conv+silu.

  • Étend la fusion MMVQ GLU pour gérer les types de quantification mixtes dans le backend SYCL.
  • Ajoute des fusions rms_norm+scale et ssm_conv+silu pour SYCL.
  • Corrige les problèmes d'espacement et convertit une macro en fonction modèle.
  • Fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, GPU et NPU incluant CUDA, Vulkan, ROCm et OpenVINO.

Cette mise à jour améliore les performances et la compatibilité pour l'accélération matérielle basée sur SYCL au sein de l'écosystème llama.cpp.