El proyecto llama.cpp ha fusionado actualizaciones significativas en su backend OpenVINO, principalmente habilitando el soporte para la familia de modelos Qwen3.5 e introduciendo varias técnicas de optimización de memoria.
- Habilitadas las operaciones GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT y filas de conjunto multidimensional.
- Corregidos problemas de precisión en las arquitecturas Gemma3n, Phi-3-mini (RoPE NEOX), MPT, Kimi-linear y Minimax-m3.
- Implementado GGML_OPENVINO_RELEASE_WEIGHTS para liberar el RSS de peso del host después de la compilación, reduciendo el uso de memoria en estado estable de ~1555 MB a ~710 MB para Llama-3.2-1B-Q4_K_M en GPU integrada Arc.
- Añadida la requantización de pesos en streaming para reducir el pico RSS en tiempo de compilación en 1.06 GB para modelos de 1B y 2.0 GB para modelos de 8B.
- Introducida una caché de modelo frontend (GGML_OPENVINO_MODEL_CACHE_DIR) para omitir la conversión de gráficos y la compilación en cargas repetidas.
Estos cambios mejoran la compatibilidad con arquitecturas más recientes como Qwen3.5 y reducen significativamente tanto las huellas de memoria transitorias en tiempo de compilación como las del estado estable para inferencia en GPU.