llama.cpp プロジェクトはバージョン b10726 をリリースし、IQ 量子化モデルでの大規模バッチサイズの処理に対する顕著なパフォーマンス最適化を導入しました。主な更新では、AVX2 命令を利用して、バッチ化された GEMM 演算を通じてグリッド IQ 量子化を加速します。
- グリッド IQ 量子化のためのバッチ化された GEMM 実装
- 高速化のために閾値を下げて IQ パネルのデコードをベクトル化
- ggml_gemm_iqp_8x8_q8_K_p4 カーネルの導入と gather バッファの削除
- 単一ソースの gather レイアウト、ゲートバイアス、IQ パネル用のベクトル化インターリーブ
- IQP カバレッジのための NUMA フォールバックサポートと 10行バッチテストの追加
このリリースにより、互換性のあるハードウェアで IQ モデルを実行しているユーザーは、より高速な推論機能を利用できます。