DeepSeek telah merilis DeepSeek-V3, model bahasa Mixture-of-Experts (MoE) yang kuat dengan total 671B parameter dan 37B diaktifkan per token. Model ini memanfaatkan Multi-head Latent Attention dan strategi load balancing tanpa auxiliary-loss, dilatih pada 14,8 triliun token menggunakan presisi campuran FP8.

  • DeepSeek-V3 mencapai performa setara dengan model tertutup terkemuka sambil hanya memerlukan 2,788M jam GPU H800 untuk pelatihan penuh.
  • Model ini mengintegrasikan Multi-Token Prediction (MTP) untuk akselerasi inferensi dan mendistilasi kemampuan penalaran dari seri DeepSeek-R1.
  • Bobot disediakan dalam format FP8, dengan skrip konversi tersedia untuk eksperimen BF16.
  • Penyebaran lokal didukung melalui kerangka kerja termasuk SGLang, vLLM, LMDeploy, dan TensorRT-LLM pada perangkat keras NVIDIA, AMD, dan Huawei Ascend.

Rilis ini menyediakan alternatif open-source yang efisien dan berkinerja tinggi untuk pengembang, dengan hasil evaluasi komprehensif yang menunjukkan kekuatannya dalam tugas matematika dan kode.