Proyek llama.cpp telah menggabungkan pembaruan signifikan pada backend OpenVINO-nya, terutama mengaktifkan dukungan untuk keluarga model Qwen3.5 dan memperkenalkan beberapa teknik optimasi memori.

  • Mengaktifkan operasi GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT, dan baris set multi-dimensi.
  • Memperbaiki masalah akurasi pada arsitektur Gemma3n, Phi-3-mini (NEOX RoPE), MPT, Kimi-linear, dan Minimax-m3.
  • Mengimplementasikan GGML_OPENVINO_RELEASE_WEIGHTS untuk melepaskan RSS berat host setelah kompilasi, mengurangi penggunaan memori steady-state dari ~1555 MB menjadi ~710 MB untuk Llama-3.2-1B-Q4_K_M pada iGPU Arc.
  • Menambahkan requantisasi berat streaming untuk mengurangi puncak RSS saat kompilasi sebesar 1.06 GB untuk model 1B dan 2.0 GB untuk model 8B.
  • Memperkenalkan cache model frontend (GGML_OPENVINO_MODEL_CACHE_DIR) untuk melewati konversi grafik dan kompilasi pada pemuatan berulang.

Perubahan ini meningkatkan kompatibilitas dengan arsitektur baru seperti Qwen3.5 dan secara signifikan mengurangi jejak memori transien saat kompilasi maupun steady-state untuk inferensi GPU.