Backend ggml-openvino untuk llama.cpp telah diperbarui ke versi 2026.4.1, memperkenalkan optimasi kinerja, dukungan operator yang lebih luas, dan peningkatan enumerasi perangkat.

  • Penggabungan perutean Mixture-of-Experts (MoE) dan normalisasi GDN QK, dengan penggabungan GPU MoE diaktifkan secara default.
  • Dukungan untuk bobot gate-up terintegrasi pada model seperti gemma-4, meningkatkan throughput prefill dari 66.16 menjadi 1608.73 t/s pada Arc B390.
  • Perbaikan penanganan sumbu rank-3 dalam eksekusi stateful, mengatasi penghentian pembangunan grafik untuk model MoE.
  • Implementasi enumerasi perangkat dan pelaporan memori yang sesuai dengan PRD, memastikan pembedaan GPU/IGPU yang akurat.
  • Penambahan opsi k-requant q4_asym64 dan mode cache_only untuk mengimpor model yang telah dikompilasi langsung dari disk.

Perubahan ini meningkatkan kinerja inferensi untuk arsitektur MoE dan memberikan deteksi serta konfigurasi perangkat keras yang lebih andal bagi pengguna OpenVINO.