أطلقت شركة DeepSeek نموذج DeepSeek-V3، وهو نموذج لغوي قوي من نوع Mixture-of-Experts (MoE) يحتوي على إجمالي 671 مليار معامل مع تفعيل 37 مليار منها لكل توكن. يستخدم النموذج الانتباه اللاتنت متعدد الرؤوس واستراتيجية موازنة أحمال خالية من الخسارة المساعدة، وتم تدريبه على 14.8 تريليون توكن باستخدام الدقة المختلطة FP8.
- يحقق DeepSeek-V3 أداءً يقارن بالنماذج المغلقة الرائدة مع الحاجة فقط إلى 2.788 مليون ساعة من وحدات معالجة الرسومات H800 للتدريب الكامل.
- يدمج النموذج التنبؤ متعدد التوكنات (MTP) لتسريع الاستدعاء ويستخلص قدرات الاستدلال من سلسلة DeepSeek-R1.
- تُقدم الأوزان بتنسيق FP8، مع توفر نصوص برمجية للتحويل لإجراء تجارب BF16.
- يتم دعم النشر المحلي عبر أطر عمل تشمل SGLang وvLLM وLMDeploy وTensorRT-LLM على عتاد NVIDIA وAMD وHuawei Ascend.
يوفر هذا الإصدار بديلاً مفتوح المصدر فعالاً وعالي الأداء للمطورين، مع نتائج تقييم شاملة توضح قوته في مهام الرياضيات والبرمجة.