llama.cpp 项目发布了版本 b10427,其中包括通过 SYCL 针对 Intel Arc GPU 的性能优化。该更新实现了在 q4_K 密集前馈网络 (FFN) 层内对 gate、up 和 GLU 操作的融合。

  • 在 Arc Pro B70 上使用 llama-bench 测量,qwen2.5-3B-Instruct 的吞吐量提升了 2.8%,gemma-2-2b-it 提升了 2.0%。
  • qwen2.5-3B 的批量推理基准测试显示出显著增益:批次大小为 1 时提升 +3.4%,B=2 时提升至 +10.1%,B=4 时提升至 +10.7%,B=8 时提升至 +12.4%。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了预编译二进制文件,支持 CPU、CUDA、Vulkan、ROCm 和 OpenVINO 后端。