llama.cpp プロジェクトはビルド b10777 をリリースしました。これには、Q4_K 多列行列-ベクトル乗算 (MMVQ) 用の SYCL バックエンドの最適化が含まれています。今回の更新は、重みのアンパックと活性化の再利用戦略を通じて冗長な計算作業を削減することに重点を置いています。

  • Q4_K 重みのアンパックを最適化し、宛先列間でデータを再利用します。
  • 2つの出力行にわたる小さな N 値(N=2..4)に対して、活性化のサブグループ再利用を実装します。
  • 効率を向上させるため、2行の再利用パターンを N=2 に限定してゲートします。
  • マジックナンバーの閾値を Q4_K_MMVQ_ROW_PAIR_MIN_NROWS=6272 に更新し、Q4_K MUL_MAT カバレッジの性能テストを追加しました。

このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL を含むさまざまなハードウェアバックエンド向けに、macOS、Linux、Android、Windows、openEuler 用のプリビルドバイナリを提供しています。