llama.cpp 项目发布了构建版本 b11370,其中包含一项 CUDA 优化,可将共享专家融合到具有向量量化 (MMVQ) 的 MoE 混合架构中。此更改是 pull request #29184 的一部分,还解决了 stride_col_dst 的缓冲区空值检查和参数处理问题。

  • 将共享专家融合到 MMVQ 以支持 CUDA 后端。
  • 为缓冲区添加空值检查以提高稳定性。
  • 将 stride_col_dst 移至融合参数。

此版本为 macOS、Linux、Windows、Android 和 iOS 提供了更新的二进制文件,适用于包括 CPU、Vulkan、ROCm、OpenVINO、SYCL 和 Snapdragon 在内的各种硬件加速器。