Les chercheurs présentent Kimi K2, un grand modèle de langage à experts multiples (Mixture-of-Experts) comportant 32 milliards de paramètres activés sur un total d'un billion. Le modèle utilise le nouvel optimiseur MuonClip pour résoudre les instabilités d'entraînement tout en maintenant l'efficacité des tokens lors du pré-entraînement sur 15,5 billions de tokens.

  • Kimi K2 atteint des performances de pointe parmi les modèles ouverts sans réflexion, obtenant 66,1 sur Tau2-Bench et 76,5 sur ACEBench (En).
  • Il atteint 65,8 sur SWE-Bench Verified et 47,3 sur SWE-Bench Multilingual, surpassant la plupart des références ouvertes et fermées dans les configurations sans réflexion.
  • Le modèle démontre de solides capacités en codage et raisonnement avec des scores de 53,7 sur LiveCodeBench v6, 49,5 sur AIME 2025 et 75,1 sur GPQA-Diamond.
  • L'entraînement postérieur implique un processus multi-étapes incluant la synthèse à grande échelle de données agentices et l'apprentissage par renforcement conjoint pour améliorer les capacités agentices.

La publication des points de contrôle du modèle de base et post-entraîné vise à faciliter la recherche future et les applications de l'intelligence agentic.