llama.cpp 项目发布了 b11160 版本,在 AMD RDNA3 和 RDNA4 架构的 Vulkan 上引入了 int8 协同矩阵 (coopmat1) 实现。此更新包含一个专用着色器,直接探测 coopmat 值以提升性能。
- 为 mul_mmq_cm1 整数矩阵乘法着色器添加了 IQ4_XS 量化支持。
- 为 Vulkan 后端实现了内联缩放应用、标量求和和双缓冲。
- 支持 q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k 和 nvfp4 量化。
- 包含适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,涵盖 CPU、CUDA、ROCm、OpenVINO 和 SYCL 后端。