Proyek llama.cpp merilis build b10871, memperkenalkan shader mul_mat_vec_iq4_xs khusus untuk jalur dmmv di Vulkan. Perubahan ini menggantikan implementasi fallback generik sebelumnya untuk meningkatkan kinerja pada perangkat keras RDNA4.
- Shader baru menyediakan generasi token sekitar 6-17% lebih cepat tergantung pada model yang digunakan.
- Cabang eksperimental yang mencoba membuka loop blok sepenuhnya untuk n_it <= 8 telah dihapus karena secara fungsional setara dengan loop sederhana yang dipertahankan dalam kode.
- Biner tersedia untuk macOS, Linux, Windows, Android, dan openEuler di backend CPU, CUDA, ROCm, OpenVINO, SYCL, dan Vulkan.