llama.cpp 项目发布了版本 b11042,引入了针对非 MoE 模型的 A8 Q6_K 新 OpenCL 二进制内核。此更新还包括修复 OpenCL 后端内的布局兼容性问题。

  • 添加了 `kernel_gemm_noshuffle_q6_k_f32_32b_trans_ila_a8_bin` OpenCL 内核。
  • 解决了 OpenCL 实现中的布局兼容性问题。
  • 为 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL)和 openEuler 提供二进制文件。

此发布版在保持与主要操作系统和 GPU 架构的广泛兼容性的同时,扩展了对 OpenCL 设备上特定量化格式的硬件支持。