llama.cpp b10089 リリースは、k-quants、i-quants、mxfp4 量子化フォーマットをサポートするように CUDA GET_ROWS 操作を拡張します。この変更により、量子化されたすべての GGML タイプが埋め込みルックアップの直接デバイスパスを使用できるようになります。

  • Q4_K_M などの一般的な GGUF レシピを処理するための k-quant サポート (q2_K から q6_K) を追加。
  • 32 スレッドレイアウトを持つ 9 つの i-quants に共有スーパーブロック脱量子化器を拡張。
  • mxfp4 脱量子化器を共有ヘルパーに移動し、CUDA 上の GET_ROWS タイプカバレッジを閉じます。
  • 不要なホストフォールバックを防ぐため、32 値サブブロックタイプ (iq4_nl および mxfp4) のみの行サイズチェックをゲートします。

これらの量子化タイプに対してスケジューラがホストにフォールバックするのを防ぐことで、このアップデートはシングルデバイスグラフ内の各トークンで完全な埋め込み行列をコピーするのを回避します。