llama.cppのggml-openvinoバックエンドがバージョン2026.4.1に更新され、パフォーマンスの最適化、演算子のサポート拡大、およびデバイスの列挙改善が導入されました。
- Mixture-of-Experts (MoE) ルーティングとGDN QK正規化の融合、GPU MoE融合がデフォルトで有効化。
- gemma-4などのモデルにおけるfused gate-upウェイトのサポートにより、Arc B390上でprefillスループットが66.16から1608.73 t/sに向上。
- 状態保持実行におけるrank-3軸処理の修正により、MoEモデルでのグラフ構築中止を解消。
- PRD準拠のデバイス列挙とメモリレポートの実装により、GPU/IGPUの正確な区別を保証。
- ディスクからコンパイル済みモデルを直接インポートするためのk-requeruオプションq4_asym64およびcache_onlyモードの追加。
これらの変更により、MoEアーキテクチャの推論パフォーマンスが向上し、OpenVINOユーザー向けにより信頼性の高いハードウェア検出と構成が可能になりました。