llama.cpp 项目已将其 OpenVINO 后端的重大更新合并,主要启用了针对 Qwen3.5 模型系列的支持,并引入了多项内存优化技术。
- 启用了 GPT-OSS MoE、MXFP4、FILL、SIGMOID、SQR、SQRT 以及多维集合行操作。
- 修复了 Gemma3n、Phi-3-mini (NEOX RoPE)、MPT、Kimi-linear 和 Minimax-m3 架构中的精度问题。
- 实现了 GGML_OPENVINO_RELEASE_WEIGHTS,在编译后释放主机权重 RSS,将 Arc iGPU 上 Llama-3.2-1B-Q4_K_M 的稳定状态内存使用量从约 1555 MB 降低至约 710 MB。
- 添加了流式权重重新量化功能,将 1B 模型的编译期间峰值 RSS 减少 1.06 GB,将 8B 模型减少 2.0 GB。
- 引入了前端模型缓存(GGML_OPENVINO_MODEL_CACHE_DIR),以跳过重复加载时的图转换和编译过程。
这些更改提高了与 Qwen3.5 等较新架构的兼容性,并显著降低了 GPU 推理期间的瞬态编译期间内存占用和稳定状态内存占用。