Proyek llama.cpp merilis versi b10839, yang mengatasi crash keras di backend Vulkan yang disebabkan oleh offset tidak sejajar selama operasi pengambilan baris tensor. Sebelumnya, model seperti Qwen3-TTS dan Qwen3-VL akan gagal saat menggunakan `ggml_view` dengan offset tampilan bukan nol karena shader melakukan assert pada pelanggaran penyetelan relatif terhadap `minStorageBufferOffsetAlignment`. Pembaruan ini mengimplementasikan dukungan asli untuk offset yang diselaraskan di kedua jalur terkuantisasi dan tidak terkuantisasi, menghilangkan kebutuhan akan fallback CPU.
Perubahan teknis utama meliputi:
- Mengikat offset buffer ke posisi yang diselaraskan di dekat offset tampilan dan meneruskan misalignment yang disesuaikan melalui push constants untuk mencegah kesalahan pemotongan.
- Menambahkan parameter `use_view_offs` ke `ggml_vk_tensor_subbuffer` untuk menangani offset fisik dengan benar pada GPU UMA dan diskrit.
- Memperkenalkan `ggml_vk_get_adjusted_misalign` untuk menemukan misalignment valid terkecil yang memenuhi persyaratan penyetelan buffer penyimpanan.
- Menghapus fallback CPU defensif sebelumnya di `supports_op()` karena backend Vulkan kini menangani kasus-kasus ini secara asli.
- Menambahkan cakupan pengujian backend yang komprehensif untuk offset tampilan bukan nol di berbagai tipe data, dengan semua 223 tes GET_ROWS berhasil pada NVIDIA RTX 5060 Ti.
Perbaikan ini memastikan eksekusi stabil model yang mengandalkan tampilan tensor kompleks dan irisan cache KV pada perangkat keras Vulkan tanpa memerlukan offloading CPU.