Proyek llama.cpp merilis build b10672, yang memperbarui backend OpenVINO ke versi 2026.3.1 dan menambahkan dukungan untuk model Whisper.cpp pada NPU.
- Backend OpenVINO kini menggabungkan konvolusi IM2COL + MatMul menjadi satu operasi konvolusi OpenVINO.
- Model Qwen3.5 diaktifkan untuk dieksekusi pada NPU melalui backend yang diperbarui.
- Operasi baru termasuk RELU, POOL_2D, QUICK_GEGLU, dan ROLL didukung di backend OpenVINO.
- Penanganan bentuk statis telah dikoreksi untuk memperbaiki masalah propagasi dimensi slot dinamis dan independensi jumlah token.
- Logika prefill terpotong diperbaiki untuk mencegah token yang dipad menjadi secara permanen masuk ke dalam cache rekuren.
- Variabel lingkungan baru GGML_OPENVINO_NPU_COMPILE_CONFIG memungkinkan pengguna mengonfigurasi parameter kompilasi NPU, seperti optimization-level=3.
Pembaruan ini meningkatkan kinerja inferensi dan kompatibilitas model bagi pengguna OpenVINO, khususnya yang menargetkan Intel NPUs.