llama.cpp 项目发布了版本 b10456,其中包含对量化复制内核启动中 SYCL 后端的关键修复。该更新调整了线程和块计数,使其与量化大小成正比,有效减少了欠分配和过分配问题。
- 修复了量化 cpy 内核启动中的线程/块计数(PR #27160)。
- Arc 70 上 q4_0 -> f32 路径的吞吐量从 20.21 GB/s 增加到 158.19 GB/s。
- 其他量化路径显示出平稳的性能提升。
- 二进制文件适用于 macOS、Linux、Windows、Android 和 openEuler,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO 和 SYCL 后端。
此更改显著提高了使用 SYCL 后端的 Intel Arc GPU 上的数据传输效率,解决了量化操作中的一个主要性能瓶颈。