llama.cpp b10858 版本引入了针对相邻 UNARY 激活(GELU、SIGMOID、SILU、SOFTPLUS)和 MUL 操作的 Vulkan 内核融合。通过消除冗余内存访问和运行时分支,该优化恢复了 10-18% 的提示处理速度回归。
- 融合管道使用专用的 SPIR-V 着色器处理带有 MUL 的 GELU、SIGMOID、SILU 和 SOFTPLUS,支持 f32 和 f16。
- 图优化器现在即使在被 VIEW 或 RESHAPE 等零计算节点隔开的情况下也能调度融合对,将支持范围扩展到 Gemma4 等模型中发现的模式。
- 支持 OP-on-B 融合,允许在较小的 MUL 操作数上进行激活,从而在共享专家架构中实现高效的门控。
- 后端测试涵盖包括 'gate' 和 'view_mid' 在内的新布局,以验证各种张量形状下的正确性。
通过减少 Vulkan 后端的计算开销,该更改显著改善了严重依赖激活门控机制的模型的推理延迟。