llama.cpp プロジェクトはビルド b10835 をリリースしました。これには、f16 flash attention の ggml-cuda 実装における発散バリアの問題の修正が含まれています。このアップデートでは、同じモジュール内の重複するメタデータポインターの設定も修正されています。
- ggml-cuda f16 flash attention の発散バリアを修正 (PR #27870)。
- ggml-cuda での重複するメタデータポインターの設定を防ぐ。
このリリースでは、CUDA、Vulkan、ROCm、SYCL を含むさまざまな CPU および GPU バックエンド向けに、macOS、Linux、Windows、Android、openEuler の更新されたバイナリが提供されます。