أطلقت DeepSeek نموذج DeepSeek-V3، وهو نموذج لغة من نوع Mixture-of-Experts (MoE) يحتوي على إجمالي 671 مليار معلمة مع تفعيل 37 مليار منها لكل توكن. تم تدريب النموذج على 14.8 تريليون توكن ويستخدم Multi-head Latent Attention واستراتيجية موازنة الحمل بدون خسارة مساعدة.

  • يحقق DeepSeek-V3 أداءًComparable للنماذج المغلقة الرائدة بينما يتطلب فقط 2.788 مليون ساعة من وحدات معالجة الرسومات H800 للتدريب.
  • يتضمن هدف التنبؤ متعدد التوكنات (MTP) ويستخلص قدرات الاستدلال من سلسلة DeepSeek-R1.
  • يدعم النموذج الاستدلال عبر مكتبات مثل Transformers وvLLM وSGLang وLMDeploy.

يوفر الإصدار وصولاً مفتوح المصدر لنموذج أساسي عالي الأداء يتمتع بقدرات قوية في الرياضيات والبرمجة.