llama.cppプロジェクトは、汎用の数行の行列乗算(MMA)カーネルを拡張し、BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0、および各種IQ形式を含む追加のソースデータ型をサポートしました。この更新により、最適化されたカーネルは16ビット重みのデ量子化子を持つ任意の型を処理できるようになり、パフォーマンスが既存のカーネルを上回り始めるM3 Ultraハードウェアでは特定の行数しきい値が適用されます。

  • 新しいサポート対象にはBF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0、およびIQ形式が含まれます。
  • 型ごとにパフォーマンスのしきい値が異なります:TQ2_0は5行、BF16は4行、MXFP4/Q2_0/Q2_K/IQ4_NLは3行、その他は2行です。
  • M3 Ultraでのベンチマーク結果では、行数やカーネルの重複度に応じてパフォーマンス比が0.23から1.01の範囲で変動しました。

この変更により、低行数におけるMMAカーベルの能力を活用し、より広範な量子化フォーマットに対する推論効率を向上させます。