llama.cpp b11224 版本解决了 Vulkan 后端中矩阵乘法操作读取较大、带步长的张量(如 KV 缓存)切片时计算结果不正确的问题。
- src0 和 src1 原地张量的批次步长现在正确地从 nb[2] 推导,而不是 ne00*ne01,确保在所有注意力头中正确访问行。
- 通过 ggml_nbytes 或 ggml_vk_subbuffer 按步长范围大小调整原地 A 和 B 的范围,以防止在没有 coopmat2 的 NVIDIA 硬件上读取清零数据或挂起。
- mul_mat_id 和 mul_mm 路径已更新以正确处理步长专家视图和部分图块,避免 NVFP4 操作挂起。
此修复确保了依赖 Vulkan 后端中步长内存布局的解码器自注意力机制的推理结果准确。