llama.cpp 项目发布了构建版本 b10576,重新添加了用于 SYCL 支持的 Q2_K 重排序 MMVQ 和 ESIMD 内核。此更改有效地撤销了之前移除这些特定内核实现的提交。
- 该发行版包含适用于 macOS(Apple Silicon 和 Intel)、Linux(Ubuntu x64、arm64、s390x)、Windows 和 Android 的二进制文件。
- GPU 加速支持通过 Vulkan、ROCm 7.14、OpenVINO、CUDA 12/13 和 SYCL 在多个平台上实现。
- macOS KleidiAI 支持在此构建中保持禁用状态。
此更新恢复了针对 SYCL 设备的特定量化内核,同时为各种操作系统和硬件加速器提供了全面的二进制文件。