llama.cpp プロジェクトはバージョン b10840 をリリースし、CUDA 推論の性能最適化を導入しました。このアップデートは、行列-ベクトル乗算 (mmvq) の高速化のために Q4_K および Q5_K 量子化フォーマットに対する分岐なし計算を実装しています。
- 分岐なし展開により、mmvq 内の各列でのスケール再実行が防止され、バッチサイズが 1 より大きい場合にパフォーマンスが向上します。
- L2 プリフェッチロジックは、DGX Spark ハードウェアに対してのみゲートされており、利益が実現されるようにしています。
- mmvq の L2 プリフェッチガードは、CUDA とともに MUSA および HIP バックエンドのサポートも拡張されました。
- Q4_K のスイッチポイントは、より広範なモデル範囲に対応するために更新されました。
これらの変更により、バッチサイズが 1 を超える DGX Spark システムで llama.cpp を実行するユーザーに測定可能なパフォーマンス向上が提供されます。