Proyek llama.cpp telah merilis build b10165, yang memulihkan dukungan kuantisasi iq4_nl untuk backend Flash Attention (FA) Vulkan. Perubahan ini mengatasi masalah #23681 dengan mengaktifkan kembali fitur tersebut setelah kekhawatiran mengenai penggunaan memori bersama dianggap sepele.
- Menambahkan kembali dukungan iq4_nl ke implementasi Vulkan FA.
- Menambahkan dukungan q1_0 untuk konfigurasi non-coopmat2.
- Memperbaiki masalah GitHub #23681 terkait penghapusan dukungan FA q1_0.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, dan Android melalui backend CPU, CUDA, ROCm, OpenVINO, SYCL, dan Vulkan.