llama.cpp 项目发布了版本 b10704,更新了 CUDA 后端以使用优化的 mm_ids_helper 路径来处理任意数量的使用专家(n_expert_used)。此前,此快速路径受限于 warp 大小的可整除性规则,迫使大多数计数回退到较慢的通用实现。

  • 该优化将填充推广到下一个 2 的幂,允许像 n_expert_used = 10 这样的情况利用快速路径。
  • 在 RTX PRO 6000 上对 Qwen3.8-Flash-Next(512 个专家,使用 10 个,上下文长度 55k)进行测量,提示处理速度从每秒 2334 个 token 增加到 2600 个 token。
  • Token 生成性能保持不变,因为该优化针对的是批处理 token 处理。

通过减少提示处理期间的开销,此更改提高了使用 Mixture of Experts 架构模型的推理延迟。