Le projet llama.cpp a publié la version b10425, qui inclut un port de l'optimisation SYCL pour fusionner la copie d'écriture d'état gated-delta-net.
- Le changement améliore les performances d'environ 1,2 % sur le matériel Arc Pro B70 lors de l'exécution de Qwen 3.6 27B avec des passes A/B entrelacées.
- La latence de pré-remplissage (pp2048) reste stable, tandis que la vitesse de génération de tokens augmente légèrement.
- Les binaires sont disponibles pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, Vulkan, ROCm, OpenVINO et SYCL.
Cette version fournit des builds mis à jour pour diverses plateformes et accélérateurs afin de prendre en charge les dernières optimisations de modèles.