llama.cpp b11265 版本包含对 Vulkan 后端处理混合专家(MoE)模型的修复。该更新修正了 `mat_mul_id` 选择矩阵乘法图块的方式,解决了在分发期间工作线程空闲的性能问题。

  • 以前,图块选择依赖于总 token 数,这对于 MoE 分发网格是不正确的,因为每个工作组中真正的 N 是每个专家的行数。
  • 在 Sarvam 30B 等模型上使用 pp128 时,此错误导致选择器为大约 6 个活动行选择图块,而不是 128 个。
  • 修复确保了组中的所有工作线程都有工作可做,消除了之前占作业持续时间 55% 的浪费时间。

此更改通过确保 GPU 工作线程之间正确的工作负载分布,提高了 Vulkan 上 MoE 模型的推理效率。