llama.cpp b11095 リリースでは、HMX 最適化の GATED_DELTA_NET (GDN) 実装が導入され、Hexagon および Flash Attention カーネルのさまざまな最適化も含まれています。

  • GDN サポートには、Qualcomm チップでのパフォーマンス向上のためのパイプライン処理、HVX スレッド処理、ベクトル演算が含まれます。
  • Flash Attention の更新により、レジスタ内蓄積と DMA パイプラインの改善を通じて、トークン生成中の DDR 読み取りが 20-30% 削減されます。
  • このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO バックエンド向けに、macOS、Linux、Windows、Android、openEuler のバイナリが提供されています。

このアップデートは、既存のデプロイメント環境との広範な互換性を維持しつつ、特定のハードウェアアーキテクチャでの推論効率を向上させます。