llama.cpp プロジェクトは、Hexagon バックエンドの最適化を含むビルド b11272 をリリースしました。主な変更点は、Qualcomm Snapdragon ハードウェアでのパフォーマンス向上のために連結演算を最適化することです。
- gather/transpose のホットループ内のパケット数を減らし、直接ターゲットバッファに収集し、gather 同期用の特殊命令を使用しました。
- ソフトウェア除算呼び出しを fastdiv に置き換え、より高速な計算を実現しました。
- DMA-HVX パイプラインを最適化し、Hexagon 連結演算用の転置ヘルパーを追加しました。
このアップデートにより、macOS、Linux、Windows、Android、openEuler の各プラットフォーム向けに、CPU、GPU、NPU の各種バックエンド用のバイナリが提供されます。