DeepSeek-AI menghadirkan DeepSeek-V3, model bahasa Mixture-of-Experts yang kuat dengan total 671B parameter dan 37B diaktifkan per token. Model ini mengadopsi arsitektur Multi-head Latent Attention dan DeepSeekMoE untuk mencapai inferensi efisien dan pelatihan yang hemat biaya.

  • DeepSeek-V3 menjadi pelopor strategi bebas kerugian tambahan untuk penyeimbangan beban guna meminimalkan degradasi kinerja.
  • Model ini menggunakan tujuan pelatihan prediksi multi-token untuk meningkatkan kinerja benchmark secara keseluruhan.
  • Tim ini memvalidasi pelatihan presisi campuran FP8 pada model berskala sangat besar untuk pertama kalinya.
  • Pelatihan memanfaatkan 14,8 triliun token dan hanya membutuhkan 2,788 juta jam GPU H800, dengan total sekitar $5,576 juta.
  • Evaluasi menunjukkan bahwa model ini mengungguli model sumber terbuka lainnya dan menyamai model sumber tertutup terkemuka seperti GPT-4o dan Claude-3.5-Sonnet.

Laporan tersebut menekankan bahwa DeepSeek-V3 mencapai kinerja yang kuat, sebanding dengan model sumber tertutup tingkat atas, sambil mempertahankan biaya pelatihan dan stabilitas yang sangat rendah.