llama.cpp b11095 リリースでは、HMX 最適化の GATED_DELTA_NET (GDN) 実装が導入され、Hexagon および Flash Attention カーネルのさまざまな最適化も含まれています。
- GDN サポートには、Qualcomm チップでのパフォーマンス向上のためのパイプライン処理、HVX スレッド処理、ベクトル演算が含まれます。
- Flash Attention の更新により、レジスタ内蓄積と DMA パイプラインの改善を通じて、トークン生成中の DDR 読み取りが 20-30% 削減されます。
- このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO バックエンド向けに、macOS、Linux、Windows、Android、openEuler のバイナリが提供されています。
このアップデートは、既存のデプロイメント環境との広範な互換性を維持しつつ、特定のハードウェアアーキテクチャでの推論効率を向上させます。