Le backend ggml-openvino pour llama.cpp a été mis à jour vers la version 2026.4.1, introduisant des optimisations de performance, un support élargi des opérateurs et une amélioration de l'énumération des appareils.
- Fusion du routage Mixture-of-Experts (MoE) et de la normalisation GDN QK, avec la fusion MoE GPU activée par défaut.
- Support des poids gate-up fusionnés dans des modèles comme gemma-4, atteignant une augmentation du débit de préremplissage de 66,16 à 1608,73 t/s sur Arc B390.
- Correction de la gestion des axes de rang-3 dans l'exécution étatique, résolvant les aborts de construction de graphe pour les modèles MoE.
- Implémentation d'une énumération des appareils et d'un rapport de mémoire conformes à PRD, assurant une distinction précise GPU/IGPU.
- Ajout de l'option k-requant q4_asym64 et du mode cache_only pour importer directement des modèles compilés depuis le disque.
Ces modifications améliorent les performances d'inférence pour les architectures MoE et fournissent une détection matérielle et une configuration plus fiables pour les utilisateurs d'OpenVINO.