llama.cpp 项目发布了 b10833 版本,引入了 Vulkan 后端的优化,通过融合特定的归一化操作来提升推理性能。

  • 在 Vulkan 后端支持 RMS_NORM + MUL + ADD (+ MUL) 和 RMS_NORM + VIEW + SET_ROWS 的融合。
  • 扩展 ROPE + VIEW + SET_ROWS 以支持 IMROPE。
  • 作者报告在其系统上 gemma4 模型的性能提升了约 4%。

此更新为在兼容 Vulkan 硬件上运行的兼容模型提供了更快的推理速度。