Proyek llama.cpp merilis build b10871, memperkenalkan shader mul_mat_vec_iq4_xs khusus untuk jalur dmmv di Vulkan. Perubahan ini menggantikan implementasi fallback generik sebelumnya untuk meningkatkan kinerja pada perangkat keras RDNA4.

  • Shader baru menyediakan generasi token sekitar 6-17% lebih cepat tergantung pada model yang digunakan.
  • Cabang eksperimental yang mencoba membuka loop blok sepenuhnya untuk n_it <= 8 telah dihapus karena secara fungsional setara dengan loop sederhana yang dipertahankan dalam kode.
  • Biner tersedia untuk macOS, Linux, Windows, Android, dan openEuler di backend CPU, CUDA, ROCm, OpenVINO, SYCL, dan Vulkan.