llama.cpp 项目发布了 b10791 版本,引入了针对量化语言模型头和解码 GEMV 操作的重大 OpenCL 优化。此更新还包括与推测性解码和多令牌预测相关的中等批次 GEMM 改进。
- 优化用于推测性解码/MTP 的 opencl quant lm_head / decode GEMV 和中等批次 GEMM。
- 为非 Adreno 构建保护 q4_K/q6_K tiled_ns convert-kernel 注册。
- 将 q4_K MUL_MAT+GLU 融合分发专门限制在 Adreno 硬件上。
- 在 q4_K GLU 融合门控中需要 noshuffle 权重布局。
- 防止在未对齐的行步长下采用向量化 f16 mrow GEMV 路径。
- 仅在测量到性能提升的地方启用 q4_K split-K decode GEMV。
- 将 tiled lm_head/embed GEMV 默认值限制在 X2E/A8X 架构上。
该版本为 macOS、iOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、GPU 和各种加速器后端的二进制文件。