llama.cpp プロジェクトは、Hexagon バックエンドの最適化を含むビルド b11272 をリリースしました。主な変更点は、Qualcomm Snapdragon ハードウェアでのパフォーマンス向上のために連結演算を最適化することです。

  • gather/transpose のホットループ内のパケット数を減らし、直接ターゲットバッファに収集し、gather 同期用の特殊命令を使用しました。
  • ソフトウェア除算呼び出しを fastdiv に置き換え、より高速な計算を実現しました。
  • DMA-HVX パイプラインを最適化し、Hexagon 連結演算用の転置ヘルパーを追加しました。

このアップデートにより、macOS、Linux、Windows、Android、openEuler の各プラットフォーム向けに、CPU、GPU、NPU の各種バックエンド用のバイナリが提供されます。