Rilis llama.cpp b11224 mengatasi hasil komputasi yang salah di backend Vulkan ketika operasi perkalian matriks membaca irisan dari tensor yang lebih besar dan bertingkat, seperti cache KV.
- Stride batch untuk tensor src0 dan src1 in-place sekarang diturunkan dengan benar dari nb[2] alih-alih ne00*ne01, memastikan akses baris yang tepat di semua kepala.
- Rentang A dan B in-place berukuran berdasarkan ekstensi bertingkatnya menggunakan ggml_nbytes atau ggml_vk_subbuffer untuk mencegah pembacaan data yang dihapus atau hang pada perangkat keras NVIDIA tanpa coopmat2.
- Jalur mul_mat_id dan mul_mm diperbarui untuk menangani tampilan ahli bertingkat dan ubin parsial dengan benar, menghindari hang pada operasi NVFP4.
Perbaikan ini memastikan hasil inferensi yang akurat untuk mekanisme perhatian diri decoder yang bergantung pada tata letak memori bertingkat di backend Vulkan.