Cet article présente une séquence spécifique d'articles de recherche et de rapports de modèles pour aider les lecteurs à comprendre l'évolution technique derrière le modèle Kimi K3 de Moonshot AI. Il soutient que K3 n'est pas une publication isolée, mais la convergence de plusieurs fils de recherche distincts, notamment les mécanismes d'attention linéaire et les conceptions de Mixture-of-Experts (MoE) clairsemées.
- Linear Transformers Are Secretly Fast Weight Programmers : Établit le fondement en interprétant l'attention linéaire comme un système mettant à jour la mémoire associative.
- Gated DeltaNet (arXiv:2412.06464) : Introduit des mises à jour delta à porte pour améliorer la gestion de l'état sur de longues séquences.
- Kimi Linear / Kimi Delta Attention (KDA) : Présente l'architecture hybride d'attention linéaire qui sert de colonne vertébrale à K3.
- LatentMoE et Stable LatentMoE : Détaille la formulation du routage dans l'espace latent et son évolution, permettant à K3 d'activer 16 experts parmi 896 par token.
- Attention Residuals (arXiv:2603.15031) : Explique le mécanisme permettant au modèle de décider comment utiliser les réseaux résiduels pour un meilleur flux d'information.
- Kimi Model Evolution : Trace la progression de Kimi K1.5 à travers K2.5 jusqu'à K3, montrant comment chaque itération a affiné les recettes d'entraînement et l'infrastructure.
Suivre ce chemin fournit le contexte nécessaire pour comprendre pourquoi des choix architecturaux spécifiques ont été faits dans Kimi K3 plutôt que de le considérer comme un produit autonome.