Proyek llama.cpp merilis versi b10726, yang memperkenalkan optimasi kinerja signifikan untuk memproses ukuran batch besar dalam model terkuantisasi IQ. Pembaruan utama memanfaatkan instruksi AVX2 untuk mempercepat kuantisasi IQ grid melalui operasi GEMM batch.
- Implementasi GEMM batch untuk kuantisasi IQ grid
- Vektorisasi dekoding panel IQ dengan ambang batas yang diturunkan untuk percepatan
- Pengenalan kernel ggml_gemm_iqp_8x8_q8_K_p4 dan penghapusan buffer gather
- Tata letak gather sumber tunggal, bias gerbang, dan interleave tervektorisasi untuk panel IQ
- Penambahan dukungan fallback NUMA dan uji batch 10 baris untuk cakupan IQP
Rilis ini menyediakan kemampuan inferensi yang lebih cepat bagi pengguna yang menjalankan model IQ pada perangkat keras yang kompatibel.