Le projet llama.cpp a publié la version b10672, qui met à jour le backend OpenVINO vers la version 2026.3.1 et ajoute le support des modèles Whisper.cpp sur le NPU.
- Le backend OpenVINO fusionne désormais les convolutions IM2COL + MatMul en une seule opération de convolution OpenVINO.
- Les modèles Qwen3.5 sont activés pour l'exécution sur le NPU via le backend mis à jour.
- De nouvelles opérations incluant RELU, POOL_2D, QUICK_GEGLU et ROLL sont prises en charge dans le backend OpenVINO.
- La gestion des formes statiques a été corrigée pour résoudre les problèmes de propagation des dimensions dynamiques des slots et d'indépendance du nombre de tokens.
- La logique de préremplissage par chunks a été corrigée pour empêcher que les tokens padding ne soient fusionnés de manière permanente dans le cache récurrent.
- Une nouvelle variable d'environnement GGML_OPENVINO_NPU_COMPILE_CONFIG permet aux utilisateurs de configurer les paramètres de compilation du NPU, tels que optimization-level=3.
Cette mise à jour améliore les performances d'inférence et la compatibilité des modèles pour les utilisateurs d'OpenVINO, en particulier ceux ciblant les NPUs Intel.