Le projet llama.cpp a fusionné des mises à jour significatives pour son backend OpenVINO, permettant principalement le support de la famille de modèles Qwen3.5 et introduisant plusieurs techniques d'optimisation mémoire.
- Activation des opérations GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT et des lignes multi-dimensionnelles.
- Correction des problèmes de précision dans les architectures Gemma3n, Phi-3-mini (RoPE NEOX), MPT, Kimi-linear et Minimax-m3.
- Implémentation de GGML_OPENVINO_RELEASE_WEIGHTS pour libérer le RSS hôte des poids après la compilation, réduisant l'utilisation mémoire en état stable de ~1555 Mo à ~710 Mo pour Llama-3.2-1B-Q4_K_M sur iGPU Arc.
- Ajout de la requantification des poids en streaming pour réduire le pic RSS lors de la compilation de 1,06 Go pour les modèles 1B et de 2,0 Go pour les modèles 8B.
- Introduction d'un cache de modèle frontend (GGML_OPENVINO_MODEL_CACHE_DIR) pour sauter la conversion de graphe et la compilation lors des chargements répétés.
Ces modifications améliorent la compatibilité avec de nouvelles architectures comme Qwen3.5 et réduisent significativement les empreintes mémoire transitoires lors de la compilation et en état stable pour l'inférence sur GPU.