llama.cpp b10089 版本扩展了 CUDA GET_ROWS 操作,以支持 k-quants、i-quants 和 mxfp4 量化格式。此更改确保所有量化的 GGML 类型现在都可以采用直接设备路径进行嵌入查找。

  • 添加 k-quant 支持(q2_K 到 q6_K)以处理常见的 GGUF 配方,如 Q4_K_M。
  • 将共享的超块去量化器扩展到九个 i-quants,具有 32 线程布局。
  • 将 mxfp4 去量化器移至共享辅助程序,关闭 CUDA 上的 GET_ROWS 类型覆盖。
  • 仅对 32 值子块类型(iq4_nl 和 mxfp4)的门控行大小检查以防止不必要的主机回退。

通过防止调度程序对这些量化类型回退到主机,更新避免了在每个 token 的单设备图中将完整的嵌入矩阵复制回来。