llama.cpp b11463 リリースには、以前ディスパッチャーによって拒否されていた GLM-4.7 Flash の特定の Multi-Latent Attention (MLA) 形状に対して MKL flash attention を有効にする SYCL アップデートが含まれています。

  • この変更により、576/576/512 GQA-20 F16 形状が MKL パイプラインに受け入れられ、V cache が K 行のストライドビューとして処理されます。
  • メモリトラフィックを削減するために MKL flash attention のスコアを F16 で保存する試みが含まれていましたが、このビルドで後に元に戻されました。
  • Intel Arc Pro B70 において、MLA 最適化によりプロンプト処理 (pp8192) が 432.80 から 1292.29 tok/s に改善され、2.99倍の高速化を実現しました。
  • このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL のバックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されています。