Rilis llama.cpp b10981 mengatasi masalah korektivitas kritis pada jalur decoding stateful backend OpenVINO, khususnya memperbaiki dukungan untuk model seperti Gemma-4 yang menggunakan ukuran kepala per-layer. Rilis ini juga memperkenalkan optimisasi untuk inferensi Mixture of Experts (MoE) GPU dan meningkatkan kinerja melalui relayout state KV.

  • Memperbaiki kegagalan decode stateful untuk Gemma-4 dengan menangani secara benar jumlah kepala per-tipe layer dan layer sliding-window.
  • Meningkatkan kinerja decoding stateful pada GPU, dengan gemma-4-12B meningkat dari 6.27 menjadi 9.11 t/s pada kedalaman 8192.
  • Menambahkan dukungan untuk GGML_OPENVINO_REQUANT_KQUANT guna memilih target requant 4-bit dan GGML_OPENVINO_SPILL_DIR untuk menumpahkan buffer bobot ke disk.
  • Mengoptimalkan inferensi GPU MoE dengan menggabungkan blok ahli ke dalam MOECompressed dan melakukan requant pada ahli 8-bit yang dikelompokkan.
  • Mengaktifkan model encoder tanpa cache pada NPU dengan menerima tampilan RoPE QKV yang dipadatkan dan mendeteksi attention tanpa cache dari mask.
  • Memperbaiki operasi ADD/SWIGLU_CLAMP mixed-dtype dengan upcasting tipe operand yang tidak cocok ke f32 untuk menjaga presisi.

Perubahan ini memastikan inferensi yang akurat untuk arsitektur model kompleks seperti Gemma-4 sambil memberikan percepatan terukur untuk decoding stateful dan beban kerja MoE pada perangkat keras yang kompatibel.