O projeto llama.cpp lançou a versão b10427, que inclui uma otimização de desempenho para GPUs Intel Arc via SYCL. A atualização implementa a fusão das operações gate, up e GLU dentro da camada feed-forward densa (FFN) q4_K.

  • Medido em um Arc Pro B70 usando llama-bench, o throughput aumentou 2,8% para qwen2.5-3B-Instruct e 2,0% para gemma-2-2b-it.
  • Benchmarks de inferência em lote no qwen2.5-3B mostraram ganhos significativos: +3,4% com batch size 1, subindo para +10,1% com B=2, +10,7% com B=4 e +12,4% com B=8.

Este lançamento fornece binários pré-compilados para macOS, Linux, Windows, Android e openEuler nos backends de CPU, CUDA, Vulkan, ROCm e OpenVINO.