Proyek llama.cpp telah memperluas kernel Matrix Multiply (MMA) baris-minimal generiknya untuk mendukung tambahan tipe data sumber, termasuk BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0, dan berbagai tipe IQ. Pembaruan ini memungkinkan kernel yang dioptimalkan menangani tipe apa pun dengan dequantizer bobot 16-bit, menerapkan ambang batas jumlah baris spesifik pada perangkat keras M3 Ultra di mana kinerja mulai melebihi kernel saat ini.
- Dukungan baru mencakup BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0, dan tipe IQ.
- Ambang batas kinerja bervariasi per tipe: 5 baris untuk TQ2_0, 4 untuk BF16, 3 untuk MXFP4/Q2_0/Q2_K/IQ4_NL, dan 2 untuk lainnya.
- Hasil benchmark pada M3 Ultra menunjukkan rasio kinerja berkisar dari 0,23 hingga 1,01 tergantung pada jumlah baris dan tumpang tindih kernel.
Perubahan ini meningkatkan efisiensi inferensi untuk berbagai format kuantisasi dengan memanfaatkan kemampuan kernel MMA pada jumlah baris yang rendah.