Moonshot a publié les détails complets, les poids et l'infrastructure de soutien pour Kimi K3, un modèle Mixture-of-Experts de 2,8T de paramètres avec environ 104B de paramètres actifs par token. La publication inclut des rapports techniques détaillant sa pile hybride à contexte long et de nouveaux outils comme MoonEP, FlashKDA et AgentEnv.
- Kimi K3 évolue en longueur, profondeur et largeur en utilisant Kimi Delta Attention, Gated MLA et sparse LatentMoE, entraîné par distillation on-policy multi-professeur.
- Les composants d'infrastructure sont centraux dans cette publication, avec un soutien au déploiement de NVIDIA pour Dynamo et Red Hat AI fournissant des checkpoints ajustés FP8-Block Hopper.
- L'analyse des coûts indique des exigences matérielles significatives, les configurations minimales nécessitant 8x GPUs MI355X et le service en production pouvant nécessiter 64+ GPUs dans un domaine à haute bande passante.
- La publication des poids ouverts a suscité une adoption rapide par des fournisseurs comme Perplexity, Baseten et Together, qui offrent des options d'inférence hébergée en raison du coût élevé de l'auto-hébergement.
La publication souligne que les poids ouverts pour les modèles de pointe nécessitent désormais un investissement substantiel en infrastructure, déplaçant l'accès vers des offres hébergées plutôt que vers un simple déploiement autonome.