Moonshot a publié les poids de son modèle Kimi K3 sur Hugging Face, avec 2,8 billions de paramètres et une architecture mixture-of-experts avec 16 experts actifs par token. L'équipe prévoit de déployer le modèle sur des GPU A100, H200 et B300, avec des résultats de benchmarks attendus cette semaine.

  • Kimi K3 utilise l'entraînement aware quantization en MXFP4, résultant en environ 1,4 To de poids.
  • Le déploiement sur 8x A100 nécessite trois nœuds en raison de contraintes de mémoire et manque de support natif pour FP4.
  • Une configuration avec 8x H200 nécessite également au moins deux nœuds, entraînant des coûts d'interconnexion.
  • Seule la configuration 8x B300 permet de loger le modèle entier dans un seul nœud avec de l'espace pour KV cache.

Les auteurs fourniront les métriques de tokens par seconde, temps jusqu'au premier token et coût pour les trois configurations GPU d'ici la fin de la semaine.