llama.cpp 的 ggml-openvino 后端已更新至 2026.4.1 版本,引入了性能优化、扩展的操作符支持以及改进的设备枚举功能。

  • 混合专家(MoE)路由与 GDN QK 归一化的融合,默认启用 GPU MoE 融合。
  • 支持 gemma-4 等模型中的 fused gate-up 权重,在 Arc B390 上将预填充吞吐量从 66.16 提升至 1608.73 t/s。
  • 修复了状态执行中 rank-3 轴的处理问题,解决了 MoE 模型的图构建中止问题。
  • 实现了符合 PRD 标准的设备枚举和内存报告,确保准确区分 GPU/IGPU。
  • 添加了 k-requant 选项 q4_asym64 以及 cache_only 模式,用于直接从磁盘导入编译后的模型。

这些更改提升了 MoE 架构的推理性能,并为 OpenVINO 用户提供了更可靠的硬件检测和配置。