llama.cpp 项目发布了版本 b11460,在其 SYCL 后端中引入了对 IQ3_S multi-column MMVQ 量化格式的支持。此更新与标准的 CPU 和 GPU 加速选项一起包含在新构建中。

  • 该版本通过 pull request #29500 将 IQ3_S multi-column MMVQ 支持添加到 SYCL 实现中。
  • 提供了适用于 macOS(Apple Silicon 和 Intel)、Linux(x64、arm64、s390x)、Windows、Android 和 openEuler 的二进制文件。
  • GPU 加速可通过 CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO 和 OpenCL Adreno 在支持的平台上获得。
  • 包括针对 Linux 和 Android 上 Snapdragon 设备的特定构建,支持 CPU、Adreno GPU 和 Hexagon NPU。

此发布使用户能够访问最新的 SYCL 优化,并扩大了在不同架构上运行 llama.cpp 模型的硬件兼容性。