La version llama.cpp b10256 inclut un changement pour paralléliser le noyau de concaténation non contiguë pour les appareils SYCL. La mise à jour modifie la géométrie de lancement d'un groupe de travail à voie unique vers un groupe utilisant `SYCL_CONCAT_BLOCK_SIZE`.

  • Le noyau de concaténation non contiguë de SYCL lance désormais un groupe de travail plus large pour améliorer le parallélisme.
  • Les benchmarks sur un Arc Pro B70 avec Qwen3.6-27B montrent une augmentation du débit de 9,4 % (de 920 à 1006 t/s).
  • La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, Vulkan, ROCm, OpenVINO et SYCL.

Cette optimisation améliore les performances d'inférence sur les GPU Intel utilisant le backend SYCL.