llama.cpp 项目发布了构建版本 b10181,其中包含对 ggml-cuda 的修复,用于在每块共享内存少于 48 KiB 的 GPU 上禁用矩阵乘法量化(MMQ)。此前,MMQ 配置假设最小需要 48 KiB,导致在 NVIDIA Pascal GPU 和摩尔线程 MTT S70 等设备上因图块大小超过可用内存而引发致命错误。

  • 该修复在 `ggml_cuda_should_use_mmq()` 中添加了检查共享内存预算的守卫逻辑,以决定是否选择 MMQ 图块。
  • 内存不足的设备在前向传播阶段回退到 BLAS 路径,避免核心转储,同时保持令牌生成性能。
  • 此更改适用于任何报告每块共享内存少于 48 KiB 的 CUDA 设备,而不仅限于特定的 MUSA QY1 设备。

此更新防止了在共享内存有限的旧款或专用硬件上发生崩溃,通过自动使用兼容的 BLAS 后端确保推理稳定性。