Proyek llama.cpp telah merilis build b10165, yang memulihkan dukungan kuantisasi iq4_nl untuk backend Flash Attention (FA) Vulkan. Perubahan ini mengatasi masalah #23681 dengan mengaktifkan kembali fitur tersebut setelah kekhawatiran mengenai penggunaan memori bersama dianggap sepele.

  • Menambahkan kembali dukungan iq4_nl ke implementasi Vulkan FA.
  • Menambahkan dukungan q1_0 untuk konfigurasi non-coopmat2.
  • Memperbaiki masalah GitHub #23681 terkait penghapusan dukungan FA q1_0.

Rilis ini menyediakan biner untuk macOS, Linux, Windows, dan Android melalui backend CPU, CUDA, ROCm, OpenVINO, SYCL, dan Vulkan.