llama.cpp 项目发布了构建版本 b10672,将 OpenVINO 后端更新至 2026.3.1 版本,并增加了对 NPU 上 Whisper.cpp 模型的支持。
- OpenVINO 后端现在将 IM2COL + MatMul 卷积融合为单个 OpenVINO 卷积操作。
- Qwen3.5 模型已通过更新后的后端启用在 NPU 上执行。
- OpenVINO 后端新增支持 RELU、POOL_2D、QUICK_GEGLU 和 ROLL 等操作。
- 静态形状处理已修正,以修复动态槽维度传播和 token 计数独立性方面的问题。
- 分块预填充逻辑已修复,防止填充的 token 被永久折叠到循环缓存中。
- 新增环境变量 GGML_OPENVINO_NPU_COMPILE_CONFIG,允许用户配置 NPU 编译参数,例如 optimization-level=3。
此更新提升了 OpenVINO 用户的推理性能和模型兼容性,特别是针对 Intel NPUs 的用户。