llama.cpp 项目发布了 b10988 版本,针对 Mixture of Experts (MoE) 模型对 OpenCL 后端进行了更改。此次更新实现了在推测解码和多令牌预测期间,根据批次大小选择 MoE 专家矩阵乘法的逻辑。
- 根据路由数量门控预构建的 q4_0 MoE GEMM 操作。
- 停止向填充的 MoE 激活槽写入零以提高效率。
- 为 macOS、Linux、Windows、Android 和 openEuler 提供适用于 CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL 和 Adreno 平台的二进制文件。