DeepSeek-AIは、671Bの総パラメータ数と1トークンあたり37Bが活性化される強力なMixture-of-Experts言語モデルであるDeepSeek-V3を発表した。本モデルは、Multi-head Latent AttentionおよびDeepSeekMoEアーキテクチャを採用し、効率的な推論とコスト効率の高いトレーニングを実現している。

  • DeepSeek-V3は、パフォーマンスの低下を最小限に抑えるため、負荷分散における補助損失なしの戦略を先駆的に導入した。
  • 全体的なベンチマーク性能を向上させるために、マルチトークン予測の学習目標を採用している。
  • チームは、極大規模モデルに対するFP8混合精度トレーニングを初めて検証した。
  • トレーニングには14.8兆トークンが使用され、H800 GPU時間は278.8万時間、合計約557.6万ドルの費用で済んだ。
  • 評価結果は、他のオープンソースモデルを上回り、GPT-4oやClaude-3.5-Sonnetといった主要なクローズドソースモデルと同等のパフォーマンスを示している。

レポートでは、DeepSeek-V3がトップクラスのクローズドソースモデルに匹敵する強力なパフォーマンスを達成しつつ、驚くほど低いトレーニングコストと安定性を維持していることが強調されている。