DeepSeekは、合計6710億パラメータ、トークンあたり370億パラメータが活性化されるMixture-of-Experts (MoE) 言語モデル「DeepSeek-V3」をリリースしました。本モデルは14.8兆個のトークンで学習され、Multi-head Latent Attentionと補助損失なしの負荷分散戦略を採用しています。

  • DeepSeek-V3は、主要なクローズドソースモデルに匹敵するパフォーマンスを実現しながら、トレーニングには278.8万時間のH800 GPU時間のみを必要とします。
  • Multi-Token Prediction (MTP) 目的関数を組み込み、DeepSeek-R1シリーズから推論能力を蒸留しています。
  • Transformers、vLLM、SGLang、LMDeployなどのライブラリを通じて推論をサポートします。

本リリースにより、数学およびコード能力に優れた高性能なベースモデルへのオープンソースアクセスが提供されます。