llama.cpp 项目发布了版本 b10899,在其 Vulkan 后端引入了特定的性能改进。此次更新专注于优化 Qwen 模型系列的矩阵运算,并提升小 M 值的整体性能。
- 通过交换 Vulkan 中的 A/B 矩阵来优化 m=1 的 mul_mat。
- 改善小 M 维度的性能。
- 启用小 M 值的 split_k 支持。
- 调整 coopmat2 的小块与中等块选择,使其依赖于 M 而非仅依赖 N。
这些更改旨在提高兼容 Vulkan 硬件上的推理效率,特别是对于受益于指定矩阵优化的模型(如 Qwen)。