llama.cpp 项目发布了 b10657 版本,引入了用于混合专家模型的新 OpenCL 二进制内核。具体而言,该更新添加了 `kernel_gemm_moe_q4_0_q8_1_dp4a_bin` 和 `kernel_gemm_moe_mxfp4_q8_1_dp4a_bin` 以支持在兼容硬件上进行高效计算。
- 为 GEMO MOE 添加了适用于 q4_0/q8_1 和 mxfp4/q8_1 量化的 OpenCL 二进制内核。
- 提供了 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。
- 此版本中 macOS Apple Silicon 上的 KleidiAI 支持仍处于禁用状态。
此更新通过启用特定的 OpenCL 内核实现,扩展了混合专家模型的硬件兼容性。