llama.cpp 项目发布了版本 b10922,引入了用于 A8 Q4_K 非 MoE 矩阵乘法的新 OpenCL 二进制内核。此更新还包括修复布局兼容性问题并重命名代码库中的二进制内核选择辅助函数。

  • 添加了 `kernel_gemm_noshuffle_q4_k_f32_32b_trans_ila_a8_bin` OpenCL 内核。
  • 修复了 OpenCL 后端中的布局兼容性问题。
  • 重命名了二进制内核选择辅助函数以提高清晰度。

此版本为 macOS、Linux、Windows、Android 和 iOS 提供了更新的二进制文件,涵盖各种硬件后端,包括 CPU、CUDA、Vulkan、ROCm 和 SYCL。