Proyek llama.cpp telah menggabungkan pembaruan signifikan pada backend OpenVINO-nya, terutama mengaktifkan dukungan untuk keluarga model Qwen3.5 dan memperkenalkan beberapa teknik optimasi memori.
- Mengaktifkan operasi GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT, dan baris set multi-dimensi.
- Memperbaiki masalah akurasi pada arsitektur Gemma3n, Phi-3-mini (NEOX RoPE), MPT, Kimi-linear, dan Minimax-m3.
- Mengimplementasikan GGML_OPENVINO_RELEASE_WEIGHTS untuk melepaskan RSS berat host setelah kompilasi, mengurangi penggunaan memori steady-state dari ~1555 MB menjadi ~710 MB untuk Llama-3.2-1B-Q4_K_M pada iGPU Arc.
- Menambahkan requantisasi berat streaming untuk mengurangi puncak RSS saat kompilasi sebesar 1.06 GB untuk model 1B dan 2.0 GB untuk model 8B.
- Memperkenalkan cache model frontend (GGML_OPENVINO_MODEL_CACHE_DIR) untuk melewati konversi grafik dan kompilasi pada pemuatan berulang.
Perubahan ini meningkatkan kompatibilitas dengan arsitektur baru seperti Qwen3.5 dan secara signifikan mengurangi jejak memori transien saat kompilasi maupun steady-state untuk inferensi GPU.