llama.cpp 项目已添加对 Kimi-K3 文本模型的支持,实现了其混合 KDA(线性)+ MLA(全量)注意力架构,以及旧版 Kimi-Linear-48B 中不具备的五项特定架构特性。
- 实现包括跨层残差注意力、潜在 MoE、替代 SwiGLU 的情境激活、MLA 输出门控和全秩 KDA 门控。
- 路由专家以“mxfp4-pack-quantized”格式作为压缩张量分发,该格式与 ggml 的 MXFP4 位兼容,允许在不反量化的情况下进行无损重新打包。
- 新的聊天模板处理 Kimi-K3 用于推理、内容和工具调用的 XTML-ish 标记格式,包括特定的消息分隔符和令牌级跨度分割。
- 转换器修复了类型错误,并将 LLAMA_MAX_EXPERTS 从 512 增加到 1024,而模型保存器现在正确输出 kda_gate_lower_bound 参数以保留往返保真度。
此更新使用户能够在本地运行 Kimi-K3,并针对 Moonshot 的参考实现和真实生成数据验证了端到端的正确性。