llama.cpp 项目发布了版本 b11390,其中包含对 CUDA MMQ 内存故障的修复,该故障发生在专家数量显著大于微批次大小时。

  • 解决了与 Mixture-of-Experts (MMQ) 处理相关的 CUDA 后端内存故障。
  • 提供适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。
  • 包含更新的 UI 构建。

此更新通过防止特定的内存访问错误,确保在 CUDA 硬件上运行 Mixture-of-Experts 模型的用户获得稳定性。