llama.cpp 项目发布了版本 b11195,在 CPU 后端引入了针对 k-quants 的分块矩阵乘法实现。该更改将量化数据解包为 256x256 int8 分块,并使用微内核计算结果,以改善大型矩阵运算的性能。
- 分块 mul_mat 为大型矩阵乘法提供了 3-6 倍的加速效果,在 4096x64 * 64x4096 维度时达到盈亏平衡点。
- 误差率保持极低,最大误差约为 1-e04,RMSE 约为 1-e05。
- 此次发布包括修复 ARM 和 Windows 构建问题、为 Q5_K 和 IQ4_XS 基准测试统一 IQP 支持,以及优化 AVX2 内核。
该更新在保持跨支持平台的数值精度的同时,提升了大型矩阵运算的推理速度。