DeepSeek telah merilis DeepSeek-V3, sebuah model bahasa Mixture-of-Experts (MoE) yang memiliki total 671 miliar parameter dengan 37 miliar diaktifkan per token. Model ini dilatih pada 14,8 triliun token dan memanfaatkan Multi-head Latent Attention serta strategi penyeimbangan beban tanpa kerugian tambahan.
- DeepSeek-V3 mencapai kinerja yang sebanding dengan model sumber tertutup terkemuka sambil hanya memerlukan 2,788M jam GPU H800 untuk pelatihan.
- Model ini menggabungkan tujuan Prediksi Multi-Token (MTP) dan mendistilasi kemampuan penalaran dari seri DeepSeek-R1.
- Model ini mendukung inferensi melalui pustaka seperti Transformers, vLLM, SGLang, dan LMDeploy.
Rilis ini menyediakan akses sumber terbuka ke model dasar berkinerja tinggi dengan kemampuan matematika dan kode yang kuat.