Proyek llama.cpp merilis versi b11195, memperkenalkan implementasi perkalian matriks bertingkat untuk k-quants di backend CPU. Perubahan ini membongkar data terkuantisasi menjadi ubin int8 berukuran 256x256 dan menghitung hasil menggunakan mikrokernel untuk meningkatkan kinerja pada operasi matriks besar.
- mul_mat bertingkat memberikan peningkatan kecepatan 3-6x untuk perkalian matriks besar, dengan titik impas pada dimensi 4096x64 * 64x4096.
- Tingkat kesalahan tetap sangat kecil, dengan kesalahan maksimum sekitar 1-e04 dan RMSE sekitar 1-e05.
- Rilis ini mencakup perbaikan untuk build ARM dan Windows, dukungan IQP yang disatukan untuk benchmark Q5_K dan IQ4_XS, serta kernel AVX2 yang dioptimalkan.
Pembaruan ini meningkatkan kecepatan inferensi untuk operasi matriks besar sambil mempertahankan akurasi numerik di berbagai platform yang didukung.