llama.cpp プロジェクトはビルド b10758 をリリースし、Hexagon DSP 向けの MUL_MAT および MUL_MAT_ID 融合機能を導入しました。このアップデートには、Qualcomm ハードウェア上の安定性とパフォーマンスを向上させるためのいくつかの修正も含まれています。

  • HMX に到達する QKV および FFN の行列乗算を融合します。
  • 固定された ne[1] < 32K の制限を削除します。
  • 大規模な次元で vtcm バジェットを超えないようにオーバーヘッドのサイズ調整を修正します。
  • 可能な場合は MUL_MAT_ID を MUL_MAT_ID_NX 変数に融合します。
  • トレースバッファ割り当てのオーバーヘッドを減らすために、opbatch および opqueue のサイズを更新します。
  • 断片化による中止を避けるために仮想アドレス空間のデフラグメンテーションを追加します。

これらの変更により、Hexagon ベースのデバイスでのメモリ使用量と実行効率の最適化が図られます。