DeepSeek-AI présente DeepSeek-V3, un puissant modèle de langage à mélange d'experts (Mixture-of-Experts) comptant 671 milliards de paramètres au total et 37 milliards activés par token. Le modèle adopte les architectures Multi-head Latent Attention et DeepSeekMoE pour atteindre une inférence efficace et un entraînement rentable.

  • DeepSeek-V3 inaugure une stratégie d'équilibrage de charge sans perte auxiliaire afin de minimiser la dégradation des performances.
  • Il utilise un objectif d'entraînement par prédiction multi-tokens pour améliorer les performances globales sur les benchmarks.
  • L'équipe valide pour la première fois l'entraînement en précision mixte FP8 sur un modèle à échelle extrêmement large.
  • L'entraînement a utilisé 14,8 billions de tokens et n'a coûté que 2,788 millions d'heures GPU H800, totalisant environ 5,576 millions de dollars.
  • Les évaluations montrent qu'il surpasse les autres modèles open-source et égale les modèles fermés de pointe tels que GPT-4o et Claude-3.5-Sonnet.

Le rapport souligne que DeepSeek-V3 atteint des performances solides comparables à celles des meilleurs modèles fermés tout en maintenant des coûts d'entraînement et une stabilité remarquablement faibles.