DeepSeekは、トークンごとに37Bのパラメータが活性化される671B総パラメータを備えた強力なMixture-of-Experts (MoE) 言語モデルであるDeepSeek-V3をリリースしました。このモデルはMulti-head Latent Attentionと補助損失なしの負荷分散戦略を採用し、FP8混合精度で14.8兆トークンを使用してトレーニングされています。

  • DeepSeek-V3は、フルトレーニングに2.788M H800 GPU時間しか必要とせずながら、主要なクローズドソースモデルに匹敵するパフォーマンスを実現しています。
  • このモデルは推論の高速化のためにMulti-Token Prediction (MTP) を組み込み、DeepSeek-R1シリーズから推論能力を蒸留しています。
  • 重みはFP8形式で提供され、BF16での実験用に変換スクリプトも利用可能です。
  • NVIDIA、AMD、Huawei Ascendのハードウェア上で、SGLang、vLLM、LMDeploy、TensorRT-LLMなどのフレームワークを通じてローカルデプロイメントがサポートされています。

今回のリリースは、数学およびコードタスクでの強さを示す包括的な評価結果とともに、開発者向けに効率的で高性能なオープンソースの代替手段を提供します。