llama.cpp 项目发布了版本 b10997,其中包括对 Mixture of Experts (MoE) ncols_opt 图块启发式算法的更改,以支持 RDNA3.5 架构。

  • ggml/src/ggml-cuda/mmq.cu 中的代码已更新,以在条件检查中包含 RDNA3.5。
  • 在 AMD Radeon 8060S 上的性能测试显示,LFM2.5-8B-A1B-UD-Q4_K_M 的速度提升了 +16.198%,Qwen1.5-MoE-A2.7B-Q2_K 提升了 +6.189%。
  • 该版本为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、CUDA、ROCm、Vulkan、OpenVINO 和 SYCL 后端的二进制文件。