Proyek llama.cpp merilis build b10517, memperkenalkan beberapa peningkatan khusus Vulkan pada jalur dequantisasi flash attention (FA). Perubahan utama termasuk melakukan dequantisasi q8_0 KV sekali di coopmat1, melewati jalur dequantisasi FA pada coopmat2, dan mengecualikan Intel Xe1 dari jalur dequantisasi FA.

  • Vulkan sekarang melakukan fallback alih-alih abort ketika scratch FA melebihi maxStorageBufferRange.
  • Rilis ini memerlukan layout KV-cache tertentu di jalur dequantisasi FA.
  • Pemeriksaan permutasi untuk jalur FA diperketat dan waktu prealloc_x_need_sync dikoreksi.
  • Ditambahkan tes untuk skenario K/V FA yang dialokasikan secara kontigu.

Pembaruan ini meningkatkan stabilitas dan kinerja bagi pengguna Vulkan dengan menangani kasus tepi dalam manajemen memori dan kompatibilitas perangkat keras.