Proyek llama.cpp merilis build b10517, memperkenalkan beberapa peningkatan khusus Vulkan pada jalur dequantisasi flash attention (FA). Perubahan utama termasuk melakukan dequantisasi q8_0 KV sekali di coopmat1, melewati jalur dequantisasi FA pada coopmat2, dan mengecualikan Intel Xe1 dari jalur dequantisasi FA.
- Vulkan sekarang melakukan fallback alih-alih abort ketika scratch FA melebihi maxStorageBufferRange.
- Rilis ini memerlukan layout KV-cache tertentu di jalur dequantisasi FA.
- Pemeriksaan permutasi untuk jalur FA diperketat dan waktu prealloc_x_need_sync dikoreksi.
- Ditambahkan tes untuk skenario K/V FA yang dialokasikan secara kontigu.
Pembaruan ini meningkatkan stabilitas dan kinerja bagi pengguna Vulkan dengan menangani kasus tepi dalam manajemen memori dan kompatibilitas perangkat keras.