Proyek llama.cpp merilis build b10672, yang memperbarui backend OpenVINO ke versi 2026.3.1 dan menambahkan dukungan untuk model Whisper.cpp pada NPU.

  • Backend OpenVINO kini menggabungkan konvolusi IM2COL + MatMul menjadi satu operasi konvolusi OpenVINO.
  • Model Qwen3.5 diaktifkan untuk dieksekusi pada NPU melalui backend yang diperbarui.
  • Operasi baru termasuk RELU, POOL_2D, QUICK_GEGLU, dan ROLL didukung di backend OpenVINO.
  • Penanganan bentuk statis telah dikoreksi untuk memperbaiki masalah propagasi dimensi slot dinamis dan independensi jumlah token.
  • Logika prefill terpotong diperbaiki untuk mencegah token yang dipad menjadi secara permanen masuk ke dalam cache rekuren.
  • Variabel lingkungan baru GGML_OPENVINO_NPU_COMPILE_CONFIG memungkinkan pengguna mengonfigurasi parameter kompilasi NPU, seperti optimization-level=3.

Pembaruan ini meningkatkan kinerja inferensi dan kompatibilitas model bagi pengguna OpenVINO, khususnya yang menargetkan Intel NPUs.