llama.cpp 项目发布了 b10833 版本,引入了 Vulkan 后端的优化,通过融合特定的归一化操作来提升推理性能。
- 在 Vulkan 后端支持 RMS_NORM + MUL + ADD (+ MUL) 和 RMS_NORM + VIEW + SET_ROWS 的融合。
- 扩展 ROPE + VIEW + SET_ROWS 以支持 IMROPE。
- 作者报告在其系统上 gemma4 模型的性能提升了约 4%。
此更新为在兼容 Vulkan 硬件上运行的兼容模型提供了更快的推理速度。
llama.cpp 项目发布了 b10833 版本,引入了 Vulkan 后端的优化,通过融合特定的归一化操作来提升推理性能。
此更新为在兼容 Vulkan 硬件上运行的兼容模型提供了更快的推理速度。