DeepSeek telah merilis DeepSeek-V3, sebuah model bahasa Mixture-of-Experts (MoE) yang memiliki total 671 miliar parameter dengan 37 miliar diaktifkan per token. Model ini dilatih pada 14,8 triliun token dan memanfaatkan Multi-head Latent Attention serta strategi penyeimbangan beban tanpa kerugian tambahan.

  • DeepSeek-V3 mencapai kinerja yang sebanding dengan model sumber tertutup terkemuka sambil hanya memerlukan 2,788M jam GPU H800 untuk pelatihan.
  • Model ini menggabungkan tujuan Prediksi Multi-Token (MTP) dan mendistilasi kemampuan penalaran dari seri DeepSeek-R1.
  • Model ini mendukung inferensi melalui pustaka seperti Transformers, vLLM, SGLang, dan LMDeploy.

Rilis ini menyediakan akses sumber terbuka ke model dasar berkinerja tinggi dengan kemampuan matematika dan kode yang kuat.