llama.cppプロジェクトはビルドb10813をリリースし、xmem SDPA(Scaled Dot-Product Attention)パスを使用してAdreno GPU用のOpenCL実装を導入しました。このアップデートでは、GQAおよびマスクされた注意機構の数値エラーも修正されています。
- OpenCL加速用のAdreno xmem SDPAパスを追加。
- Adreno固有のキュープロファイリングオーバーライドを削除。
- GQAおよびマスクされた注意の数値エラーを修正。
- 機能を制御するためのGGML_OPENCL_XMEM_SDPA環境変数を導入。
リリースでは、CPU、GPU、専用ハードウェアバックエンド向けにmacOS、Linux、Windows、Android、openEulerのバイナリが提供されています。