El proyecto llama.cpp lanzó la versión b10427, que incluye una optimización de rendimiento para GPUs Intel Arc a través de SYCL. La actualización implementa la fusión de las operaciones gate, up y GLU dentro de la capa de red feed-forward densa (FFN) q4_K.

  • Medido en un Arc Pro B70 usando llama-bench, el rendimiento aumentó un 2,8 % para qwen2.5-3B-Instruct y un 2,0 % para gemma-2-2b-it.
  • Las pruebas de inferencia por lotes en qwen2.5-3B mostraron ganancias significativas: +3,4 % con tamaño de lote 1, aumentando a +10,1 % con B=2, +10,7 % con B=4 y +12,4 % con B=8.

Esta versión proporciona binarios precompilados para macOS, Linux, Windows, Android y openEuler en los backends de CPU, CUDA, Vulkan, ROCm y OpenVINO.