llama.cpp b10676 版本修正了 `conv_transpose_2d` 中的错误,该错误导致仅计算了第一个批次,而后续批次保持为零。此修复适用于核心 ggml 库和 Metal 后端实现。

  • ggml:源置换和计算循环现在遍历批次维度,工作缓冲区大小按批次数量缩放。
  • Metal:内核网格覆盖所有批次,从 z 坐标解码批次索引以偏移输入和目标索引。
  • 在 `test-backend-ops` 中添加了多批次测试用例以验证修复。

这确保了 CPU 和 GPU 后端的多批次卷积结果正确。