Proyek llama.cpp merilis versi b10899, memperkenalkan peningkatan kinerja spesifik pada backend Vulkan-nya. Pembaruan ini berfokus pada mengoptimalkan operasi matriks untuk keluarga model Qwen dan meningkatkan kinerja umum dengan M kecil.
- Mengoptimalkan mul_mat dengan m=1 dengan menukar matriks A/B di Vulkan.
- Meningkatkan kinerja untuk dimensi M kecil.
- Mengaktifkan dukungan split_k dengan nilai M kecil.
- Menyesuaikan pemilihan tile kecil vs. sedang untuk coopmat2 agar bergantung pada M, bukan hanya N.
Perubahan ini bertujuan untuk meningkatkan efisiensi inferensi pada perangkat keras yang kompatibel dengan Vulkan, khususnya untuk model seperti Qwen yang diuntungkan dari optimasi matriks yang ditentukan.