llama.cpp 项目发布了构建版本 b10883,其中包含对 Vulkan 后端的重大更新。主要更改涉及使用规范常量进行 A 类型矩阵-矩阵乘法运算,以改进着色器编译和性能。

  • 在 Vulkan 着色器中对 mul mat type_a 使用规范常量。
  • 合并共享内存表并通过类型规范常量减小大小。
  • 恢复 coopmat2 q4_k/q5_k 优化并分离着色器以修复 Ampere 回归问题。
  • 修复 cm2 矩阵乘法中缺失的 Q2_0 类型,并适配 f16 Intel 调优更改。
  • 通过使用最小共享内存大小 8 来规避 cm2 编译器错误。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了更新后的二进制文件,涵盖 CPU、GPU 和专用硬件后端。