O projeto llama.cpp mesclou atualizações significativas em seu backend OpenVINO, principalmente habilitando o suporte à família de modelos Qwen3.5 e introduzindo várias técnicas de otimização de memória.
- Habilitadas operações GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT e linhas set multi-dimensionais.
- Corrigidos problemas de precisão nas arquiteturas Gemma3n, Phi-3-mini (NEOX RoPE), MPT, Kimi-linear e Minimax-m3.
- Implementado GGML_OPENVINO_RELEASE_WEIGHTS para liberar o RSS de peso do host após a compilação, reduzindo o uso de memória em estado estacionário de ~1555 MB para ~710 MB no Llama-3.2-1B-Q4_K_M na iGPU Arc.
- Adicionada requantização de pesos em streaming para reduzir o pico de RSS em tempo de compilação em 1,06 GB para modelos de 1B e 2,0 GB para modelos de 8B.
- Introduzido um cache de modelo no frontend (GGML_OPENVINO_MODEL_CACHE_DIR) para pular a conversão do grafo e a compilação em carregamentos repetidos.
Essas alterações melhoram a compatibilidade com arquiteturas mais recentes como Qwen3.5 e reduzem significativamente tanto as pegadas de memória transitivas em tempo de compilação quanto as de estado estacionário para inferência em GPU.