llama.cpp 项目发布了版本 b10718,其中包含对其 CUDA 后端的重大更新。最显著的变化是将 Mixture of Experts (MOE) 融合扩展到支持推测解码(specdec),解决了之前 MOE glu 融合和 topk-router 融合仅限于一次处理一个 token 的限制。
- CUDA:将 MOE 融合扩展至 specdec,移除了早期 MOE glu 和 topk-router 融合的单 token 限制。
- 在多 token MOE 融合实现中添加了 SWIGLU_CLAMP 案例支持。
- 解决了 pull request #27621 中的审查意见。
此更新通过启用 NVIDIA GPU 上更高效的融合操作,提升了使用推测解码的模型的性能。