Proyek llama.cpp merilis versi b11195, memperkenalkan implementasi perkalian matriks bertingkat untuk k-quants di backend CPU. Perubahan ini membongkar data terkuantisasi menjadi ubin int8 berukuran 256x256 dan menghitung hasil menggunakan mikrokernel untuk meningkatkan kinerja pada operasi matriks besar.

  • mul_mat bertingkat memberikan peningkatan kecepatan 3-6x untuk perkalian matriks besar, dengan titik impas pada dimensi 4096x64 * 64x4096.
  • Tingkat kesalahan tetap sangat kecil, dengan kesalahan maksimum sekitar 1-e04 dan RMSE sekitar 1-e05.
  • Rilis ini mencakup perbaikan untuk build ARM dan Windows, dukungan IQP yang disatukan untuk benchmark Q5_K dan IQ4_XS, serta kernel AVX2 yang dioptimalkan.

Pembaruan ini meningkatkan kecepatan inferensi untuk operasi matriks besar sambil mempertahankan akurasi numerik di berbagai platform yang didukung.