llama.cpp 项目发布了构建版本 b10142,为 MiniMax-M3 模型引入了初步的视觉支持。此次更新实现了一个仅文本的端口,复用了来自 MiniMax-M2 的现有组件,包括带有每头 QK 归一化和部分旋转编码的 GQA、DeepSeek-V3 风格的专家网络以及 swigluoai 激活函数。

  • 该实现包含了 MiniMax-M3 视觉塔(mmproj + clip 图),同时移除了 MTP 头和稀疏注意力支持。
  • 性能优化包括将缓慢的 CPU 操作分解为 GPU/CPU 操作,从而在长上下文上实现巨大的速度提升,并重写索引器操作以使其成为 CUDA 原生。
  • 统一的 4-way + decode 路径将每层的节点数从约 50 个减少到约 25 个,使计算缓冲区缩小了约 20%。
  • 测量结果显示,在专家卸载设置下,解码速度从 6.2–7.15 t/s 增加到 7.7–7.8 t/s,预填充速度提高了约 10%。

在此更改之前生成的所有 GGUF 文件必须重新生成,以确保与新架构和转换逻辑的兼容性。