DeepSeek a lancé DeepSeek-V3, un modèle de langage Mixture-of-Experts (MoE) comportant 671 milliards de paramètres au total et 37 milliards activés par token. Le modèle est entraîné sur 14,8 billions de tokens et utilise Multi-head Latent Attention ainsi qu'une stratégie d'équilibrage de charge sans perte auxiliaire.

  • DeepSeek-V3 atteint des performances comparables aux modèles propriétaires leaders tout en ne nécessitant que 2,788M d'heures GPU H800 pour l'entraînement.
  • Il intègre un objectif de Prédiction Multi-Tokens (MTP) et distille les capacités de raisonnement de la série DeepSeek-R1.
  • Le modèle prend en charge l'inférence via des bibliothèques telles que Transformers, vLLM, SGLang et LMDeploy.

La publication offre un accès open source à un modèle de base haute performance doté de solides capacités mathématiques et de codage.