Proyek llama.cpp merilis build b10777, yang mencakup optimasi untuk backend SYCL pada perkalian matriks-vektor (MMVQ) multi-kolom dengan Q4_K. Pembaruan ini berfokus pada pengurangan pekerjaan komputasi redundan melalui strategi pembongkaran bobot dan penggunaan kembali aktivasi.
- Mengoptimalkan pembongkaran bobot Q4_K dan menggunakan kembali data antar kolom tujuan.
- Mengimplementasikan penggunaan kembali subgrup aktivasi untuk nilai N kecil (N=2..4) di dua baris keluaran.
- Membatasi pola penggunaan kembali dua baris secara khusus untuk N=2 guna meningkatkan efisiensi.
- Memperbarui ambang batas angka ajaib menjadi Q4_K_MMVQ_ROW_PAIR_MIN_NROWS=6272 dan menambahkan uji kinerja untuk cakupan MUL_MAT dengan Q4_K.
Rilis ini menyediakan biner pra-bangun untuk macOS, Linux, Android, Windows, dan openEuler di berbagai backend perangkat keras, termasuk CPU, CUDA, ROCm, Vulkan, OpenVINO, dan SYCL.