Proyek llama.cpp merilis build b10781, yang mencakup perbaikan untuk jalur dekuantisasi perhatian cepat (FA) Vulkan. Pembaruan ini mengatasi masalah di mana shader memeriksa `nb[3]` secara salah bahkan ketika `ne[3] == 1`, menyebabkan jalur tersebut hanya aktif ketika cache penuh.
- Melewati pemeriksaan `nb[3]` ketika `ne[3] == 1` karena shader tidak pernah membacanya untuk satu aliran.
- Menyelesaikan kesalahan logika di mana tampilan cache membawa stride buffer penuh, mengurangi pemeriksaan lama menjadi `n_kv == kv_size`.
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.
Perbaikan ini memastikan jalur dekuantisasi Vulkan FA aktif dengan benar selama inferensi daripada dibatasi hanya pada keadaan cache penuh.