Le projet llama.cpp a publié la version b10427, qui inclut une optimisation de performance pour les GPU Intel Arc via SYCL. La mise à jour implémente la fusion des opérations gate, up et GLU au sein de la couche feed-forward dense (FFN) q4_K.
- Mesuré sur un Arc Pro B70 avec llama-bench, le débit a augmenté de 2,8 % pour qwen2.5-3B-Instruct et de 2,0 % pour gemma-2-2b-it.
- Les benchmarks d'inférence par lots sur qwen2.5-3B ont montré des gains significatifs : +3,4 % avec une taille de lot de 1, augmentant à +10,1 % avec B=2, +10,7 % avec B=4 et +12,4 % avec B=8.
Cette version fournit des binaires précompilés pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, Vulkan, ROCm et OpenVINO.