llama.cpp 项目发布了版本 b11335,其中包含针对 Volta GPU 的 CUDA 优化。该更新将 sm_70 架构路由到现有的 Turing MMVQ nwarps 表,而不是回退到通用配置。
- Volta (sm_70) 现在使用 TURING 调优进行 K-quant batch-1 解码,将 warp 数量从 4 更改为 2。
- 在配备 Qwen3.8-27B 的 Tesla V100 上的基准测试显示,吞吐量增加 +3.17% (+1.091 t/s),且比特级困惑度完全相同。
- 该更改源自 anyei/llamacpp-v100 分支,适用于设备和主机表选择器。
此调整提高了 Volta 硬件上的推理速度,同时不影响模型精度。