DeepSeekは、合計6710億パラメータ、トークンあたり370億パラメータが活性化されるMixture-of-Experts (MoE) 言語モデル「DeepSeek-V3」をリリースしました。本モデルは14.8兆個のトークンで学習され、Multi-head Latent Attentionと補助損失なしの負荷分散戦略を採用しています。
- DeepSeek-V3は、主要なクローズドソースモデルに匹敵するパフォーマンスを実現しながら、トレーニングには278.8万時間のH800 GPU時間のみを必要とします。
- Multi-Token Prediction (MTP) 目的関数を組み込み、DeepSeek-R1シリーズから推論能力を蒸留しています。
- Transformers、vLLM、SGLang、LMDeployなどのライブラリを通じて推論をサポートします。
本リリースにより、数学およびコード能力に優れた高性能なベースモデルへのオープンソースアクセスが提供されます。