Proyek llama.cpp merilis versi b10427, yang mencakup optimasi kinerja untuk GPU Intel Arc melalui SYCL. Pembaruan ini mengimplementasikan penggabungan operasi gate, up, dan GLU di dalam lapisan jaringan feed-forward padat (FFN) q4_K.

  • Diukur pada Arc Pro B70 menggunakan llama-bench, throughput meningkat sebesar 2,8% untuk qwen2.5-3B-Instruct dan 2,0% untuk gemma-2-2b-it.
  • Benchmark inferensi batched pada qwen2.5-3B menunjukkan peningkatan signifikan: +3,4% pada ukuran batch 1, naik menjadi +10,1% pada B=2, +10,7% pada B=4, dan +12,4% pada B=8.

Rilis ini menyediakan biner yang telah dikompilasi sebelumnya untuk macOS, Linux, Windows, Android, dan openEuler di backend CPU, CUDA, Vulkan, ROCm, dan OpenVINO.