研究人员推出了Kimi K2,这是一个混合专家(Mixture-of-Experts)大型语言模型,在总共一万亿个参数中激活了320亿个。该模型利用新颖的MuonClip优化器来解决训练不稳定性问题,同时在前15.5万亿个token的训练过程中保持token效率。
- Kimi K2在非思考型开源模型中实现了最先进的性能,在Tau2-Bench上得分66.1,在ACEBench (En)上得分76.5。
- 它在SWE-Bench Verified上达到65.8分,在SWE-Bench Multilingual上达到47.3分,在非思考型设置中超越了大多数开源和闭源基线模型。
- 该模型在编码和推理方面展现出强大能力,在LiveCodeBench v6上得分为53.7,在AIME 2025上得分为49.5,在GPQA-Diamond上得分为75.1。
- 后训练过程包括多阶段流程,涵盖大规模智能体数据合成和联合强化学习,以提升智能体能力。
基础模型和后训练模型检查点的发布旨在促进未来智能体智能的研究与应用。