llama.cpp プロジェクトはビルド b11232 をリリースし、ggml-cpu バックエンドの更新が含まれています。今回のリリースは、x86 アーキテクチャ上でベクトル倍数ではないヘッド次元に対してタイルドフラッシュアテンションを有効化することに焦点を当てています。

  • x86 上でベクトル倍数ではないヘッド次元に対してタイルドフラッシュアテンションを有効化。
  • simd_gemm_ukernel_tail におけるマスク読み込みおよび書き込みの AVX2 サポートを追加。
  • パディング済み KV タイルに対する FA softcap の処理を修正。

このアップデートにより、CPU、GPU、NPU バックエンド向けに macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されます。