llama.cpp 项目发布了 b10726 版本,引入了针对 IQ 量化模型中大批次大小处理的显著性能优化。主要更新利用 AVX2 指令通过批处理 GEMM 操作加速网格 IQ 量化。

  • 用于网格 IQ 量化的批处理 GEMM 实现
  • IQ 面板解码的向量化,降低阈值以实现加速
  • 引入 ggml_gemm_iqp_8x8_q8_K_p4 内核并移除 gather 缓冲区
  • 单一来源 gather 布局、门控偏置和 IQ 面板的向量化交织
  • 添加 NUMA 回退支持和用于 IQP 覆盖的 10 行批次测试

此发布为在兼容硬件上运行 IQ 模型的用户提供了更快的推理能力。