llama.cpp 项目发布了版本 b10840,引入了针对 CUDA 推理的性能优化。该更新实现了 Q4_K 和 Q5_K 量化格式的无分支计算,以加速矩阵-向量乘法 (mmvq)。

  • 无分支解包防止了 mmvq 中每一列的缩放重新执行,在批次大小大于 1 时提升性能。
  • L2 预取逻辑专门针对 DGX Spark 硬件进行门控,以确保实现收益。
  • mmvq L2 预取保护扩展到支持 MUSA 和 HIP 后端以及 CUDA。
  • Q4_K 的切换点已更新,以容纳更广泛的模型范围。

这些更改为在批次大小超过一的 DGX Spark 系统上运行 llama.cpp 的用户提供了可衡量的性能提升。