Moonshot AI a présenté Kimi K3, un modèle Mixture-of-Experts open-source comportant 2,8 billions de paramètres au total et 104 milliards de paramètres activés par token. Le modèle prend en charge des capacités visuelles natives et une fenêtre de contexte d'un million de tokens, exploitant l'attention Delta Kimi et Stable LatentMoE pour atteindre une efficacité de mise à l'échelle d'environ 2,5 fois supérieure à celle de son prédécesseur, Kimi K2.

  • Kimi K3 utilise l'attention Delta Kimi et les résidus d'attention pour améliorer le flux d'informations sur la longueur de séquence et la profondeur du modèle.
  • Stable LatentMoE active efficacement 16 des 896 experts routés par token.
  • L'entraînement post-formation inclut l'apprentissage par renforcement dans les domaines général, agentic et de codage, avec plusieurs niveaux d'effort de raisonnement.
  • Le modèle atteint des performances de pointe en codage à long terme, tâches agentic, connaissances, raisonnement et vision.
  • Bien qu'il soit légèrement derrière Claude Fable 5 et GPT-5.6 Sol, il surpasse les autres modèles évalués, ouverts et propriétaires.

Moonshot AI publie les poids complets du modèle Kimi K3 pour faciliter la recherche future et accélérer le déploiement plus large de l'intelligence de pointe.