llama.cppプロジェクトはビルドb10813をリリースし、xmem SDPA(Scaled Dot-Product Attention)パスを使用してAdreno GPU用のOpenCL実装を導入しました。このアップデートでは、GQAおよびマスクされた注意機構の数値エラーも修正されています。

  • OpenCL加速用のAdreno xmem SDPAパスを追加。
  • Adreno固有のキュープロファイリングオーバーライドを削除。
  • GQAおよびマスクされた注意の数値エラーを修正。
  • 機能を制御するためのGGML_OPENCL_XMEM_SDPA環境変数を導入。

リリースでは、CPU、GPU、専用ハードウェアバックエンド向けにmacOS、Linux、Windows、Android、openEulerのバイナリが提供されています。