llama.cppプロジェクトはビルドb10672をリリースし、OpenVINOバックエンドをバージョン2026.3.1に更新し、NPU上のWhisper.cppモデルのサポートを追加しました。
- OpenVINOバックエンドは、IM2COL + MatMul畳み込みを単一のOpenVINO畳み込み演算に融合するようになりました。
- Qwen3.5モデルが、更新されたバックエンド経由でNPU上で実行可能になりました。
- RELU、POOL_2D、QUICK_GEGLU、ROLLを含む新しい演算がOpenVINOバックエンドでサポートされました。
- 静的形状の処理が修正され、動的スロット次元の伝播とトークン数非依存性の問題が解決しました。
- チャンク化プレフィルロジックが修正され、パディングされたトークンが再帰的キャッシュに恒久的に折りたたまれるのを防ぎました。
- GGML_OPENVINO_NPU_COMPILE_CONFIGという新しい環境変数が追加され、ユーザーは最適化レベル=3などのNPUコンパイルパラメータを構成できるようになりました。
このアップデートは、特にIntel NPUを対象とするOpenVINOユーザーにとって、推論パフォーマンスとモデルの互換性を向上させます。