Proyek llama.cpp merilis build b10781, yang mencakup perbaikan untuk jalur dekuantisasi perhatian cepat (FA) Vulkan. Pembaruan ini mengatasi masalah di mana shader memeriksa `nb[3]` secara salah bahkan ketika `ne[3] == 1`, menyebabkan jalur tersebut hanya aktif ketika cache penuh.

  • Melewati pemeriksaan `nb[3]` ketika `ne[3] == 1` karena shader tidak pernah membacanya untuk satu aliran.
  • Menyelesaikan kesalahan logika di mana tampilan cache membawa stride buffer penuh, mengurangi pemeriksaan lama menjadi `n_kv == kv_size`.
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.

Perbaikan ini memastikan jalur dekuantisasi Vulkan FA aktif dengan benar selama inferensi daripada dibatasi hanya pada keadaan cache penuh.