DeepSeek a publié DeepSeek-V3, un puissant modèle de langage à experts multiples (MoE) comportant 671B paramètres au total dont 37B activés par token. Le modèle utilise une attention latente multi-têtes et une stratégie d'équilibrage de charge sans perte auxiliaire, entraîné sur 14,8 billions de tokens en précision mixte FP8.

  • DeepSeek-V3 atteint des performances comparables aux meilleurs modèles propriétaires tout en ne nécessitant que 2,788M heures de GPU H800 pour l'entraînement complet.
  • Le modèle intègre la prédiction multi-tokens (MTP) pour accélérer l'inférence et distille les capacités de raisonnement de la série DeepSeek-R1.
  • Les poids sont fournis au format FP8, avec des scripts de conversion disponibles pour l'expérimentation en BF16.
  • Le déploiement local est pris en charge via des frameworks incluant SGLang, vLLM, LMDeploy et TensorRT-LLM sur du matériel NVIDIA, AMD et Huawei Ascend.

Cette publication offre une alternative open-source efficace et haute performance pour les développeurs, avec des résultats d'évaluation complets démontrant sa force dans les tâches de mathématiques et de code.