llama.cpp b10831 版本为 Vulkan 后端引入了 TQ1_0 量化支持,使矩阵乘法、mat-vec、反量化和 get_rows 等操作得以实现。此更新还修正了 Metal 后端,使其能够正确拒绝不支持的 TQ1_0 操作,确保它们回退到 CPU 执行。
- Vulkan 实现将 TQ1_0 的 3 的幂打包为 32 位常量,以避免寄存器问题。
- types.glsl 中的共享解码辅助函数取代了各个着色器文件中重复的逻辑。
- 修复了独立反量化着色器中工作组分母计算的错误。
- Metal 后端现在拒绝 GET_ROWS 和 mat-mul 的 TQ1_0,与现有的 NVFP4 处理保持一致。
- 测试用例已精简,注释已标准化为 ASCII。
Vulkan 的更改已在 AMD gfx1151 上验证,所有相关后端操作均通过测试。