أطلقت DeepSeek نموذج DeepSeek-V3، وهو نموذج لغة من نوع Mixture-of-Experts (MoE) يحتوي على إجمالي 671 مليار معلمة مع تفعيل 37 مليار منها لكل توكن. تم تدريب النموذج على 14.8 تريليون توكن ويستخدم Multi-head Latent Attention واستراتيجية موازنة الحمل بدون خسارة مساعدة.
- يحقق DeepSeek-V3 أداءًComparable للنماذج المغلقة الرائدة بينما يتطلب فقط 2.788 مليون ساعة من وحدات معالجة الرسومات H800 للتدريب.
- يتضمن هدف التنبؤ متعدد التوكنات (MTP) ويستخلص قدرات الاستدلال من سلسلة DeepSeek-R1.
- يدعم النموذج الاستدلال عبر مكتبات مثل Transformers وvLLM وSGLang وLMDeploy.
يوفر الإصدار وصولاً مفتوح المصدر لنموذج أساسي عالي الأداء يتمتع بقدرات قوية في الرياضيات والبرمجة.