llama.cpp 项目发布了版本 b11390,其中包含对 CUDA MMQ 内存故障的修复,该故障发生在专家数量显著大于微批次大小时。
- 解决了与 Mixture-of-Experts (MMQ) 处理相关的 CUDA 后端内存故障。
- 提供适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。
- 包含更新的 UI 构建。
此更新通过防止特定的内存访问错误,确保在 CUDA 硬件上运行 Mixture-of-Experts 模型的用户获得稳定性。