llama.cpp プロジェクトはビルド b10165 をリリースし、Flash Attention (FA) Vulkan バックエンドの iq4_nl 量子化サポートを復元しました。この変更は、共有メモリ使用量に関する懸念が無視できる程度であると判断された後、機能を再有効化することで問題 #23681 に対処します。

  • Vulkan FA 実装に iq4_nl サポートを再追加。
  • non-coopmat2 構成用に q1_0 サポートを追加。
  • q1_0 FA サポートの削除に関する GitHub 問題 #23681 を修正。

このリリースでは、CPU、CUDA、ROCm、OpenVINO、SYCL、および Vulkan バックエンド向けに、macOS、Linux、Windows、Android のバイナリが提供されます。