llama.cpp プロジェクトはバージョン b11062 をリリースし、Qwen4 モデルのスパース Flash Attention (FA) サポートを有効にするプルリクエストを含んでいます。

このアップデートはより広範な b11062 リリースの一部であり、CPU、GPU(CUDA、ROCm、Vulkan)、および AI アクセラレータバックエンド向けに macOS、Linux、Windows、Android、openEuler 用のバイナリを提供しています。

リリースノートで言及されている特定の変更は、効率性を向上させるために Qwen4 のスパース FA 機能を追加します。