llama.cpp プロジェクトはバージョン b10833 をリリースし、推論パフォーマンスを向上させるために特定の正規化演算を融合する Vulkan バックエンドの最適化を導入しました。

  • Vulkan バックエンドでの RMS_NORM + MUL + ADD (+ MUL) および RMS_NORM + VIEW + SET_ROWS の融合のサポート。
  • IMROPE をサポートするための ROPE + VIEW + SET_ROWS の拡張。
  • 著者は自身のシステムで gemma4 モデルにおいて約4%のパフォーマンス向上を報告しています。

このアップデートにより、Vulkan 対応ハードウェア上で動作する互換性のあるモデルの推論速度が高速化されます。