Le projet llama.cpp a publié la compilation b10322, qui inclut une optimisation de performance qui fusionne les chargements de fenêtres SSM_CONV dans le backend SYCL.

  • Sur un Arc Pro B70, des tests A/B entrelacés ont montré une accélération de 1.85x à 1.87x pour des formes de tenseur spécifiques, avec un changement négligeable pour n_t=1.
  • Les benchmarks sur les modèles Qwen35 27B Q4_K - Medium exécutant ssm_conv dans 48 des 64 blocs ont indiqué une amélioration de +2.2% du temps de traitement de la requête.
  • La version fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) et openEuler.

Cette mise à jour améliore le débit d'inférence pour les charges de travail utilisant des opérations SSM_CONV sur du matériel compatible.