llama.cpp 项目发布了构建版本 b10534,引入了特定于硬件的切换点,以在 CUDA 上的量化解码过程中调整向量路径与张量核心路径之间的交叉。
- 该版本通过 GGML_CUDA_MMVQ_MAX 添加了运行时配置,用于调整内核从 mul_mat_vec_q 切换到 MMQ 时的批次大小阈值。
- 现在包含了针对 Blackwell、DGX Spark 和 Ada 架构的具体切换点值,减少了对环境变量的依赖。
- 降低此阈值会将更大的批次路由到 int8 MMQ 张量核心路径,在 RTX 5090 上对 Q4_K 密集模型在批次大小为 8 时测得的速度提升为 23-41%。
- 该更新包含了适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO 和 SYCL 后端。
此更改通过根据批次大小和硬件能力自动选择最高效的内核路径,提升了现代 NVIDIA GPU 上的推理性能。