llama.cppプロジェクトは、Vulkanバックエンドを介してスパースFlash Attentionのサポートを導入するビルドb10982をリリースしました。このアップデートは特にDSV4およびGLMモデルを対象としており、互換性のあるGPUハードウェア上でスパース注意機構を活用できるようになります。
- Vulkan実装にDSV4/GLM向けのスパースFlash Attentionサポートを追加。
- 調整された実装ロジックと追加されたテストを含む。
- 非決定性のatomicAddの動作を修正。
- decodeベクトル用のcm2サポートおよびdecodeベクトル用のf16vec4バインディングを追加。
- ロジックを簡素化し、変数名の一貫性を改善。
本リリースでは、CPU、CUDA、ROCm、OpenVINO、SYCL、Vulkanバックエンドに対応したmacOS、Linux、Windows、Android、openEuler向けのプリコンパイル済みバイナリが提供されます。