Moonshot发布了Kimi K3的完整详情、权重和支持性基础设施,这是一个拥有约2.8万亿参数的混合专家(MoE)模型,每个token约有104B个激活参数。此次发布包括详细的技术报告,介绍了其混合长上下文堆栈以及MoonEP、FlashKDA和AgentEnv等新工具。
- Kimi K3通过Kimi Delta Attention、Gated MLA和稀疏LatentMoE在长度、深度和宽度上进行扩展,并通过多教师在线策略蒸馏进行训练。
- 基础设施组件是此次发布的核心,NVIDIA为Dynamo提供部署支持,Red Hat AI提供针对FP8-Block Hopper优化的检查点。
- 成本分析表明需要大量的硬件资源,最低配置需要8块MI355X GPU,而生产环境服务可能需要在高带宽域中使用64块以上的GPU。
- 开源权重的发布促使Perplexity、Baseten和Together等提供商迅速采用,由于自托管成本高昂,他们正在提供托管推理选项。
此次发布强调,前沿模型的开源权重现在需要大量的基础设施投入,使得访问方式从简单的自部署转向托管服务。