تقدم DeepSeek-AI نموذج DeepSeek-V3، وهو نموذج لغوي قوي من نوع Mixture-of-Experts يحتوي على 671B معلمة إجمالاً و37B مُفعّلة لكل توكن. يعتمد النموذج على بنية Multi-head Latent Attention وDeepSeekMoE لتحقيق استنتاج فعال وتدريب ميسور التكلفة.
- يُعد DeepSeek-V3 رائداً في استراتيجية موازنة الأحمال خالية من الخسارة المساعدة لتقليل تدهور الأداء.
- يستخدم هدف تدريب متعدد التوقعات للتوكنات لتعزيز أداء المعايير الشاملة.
- قام الفريق بتأكيد صحة التدريب بدقة مختلطة FP8 على نموذج ضخم النطاق لأول مرة.
- استغل التدريب 14.8 تريليون توكن وتكلف فقط 2.788 مليون ساعة من وحدات معالجة الرسومات H800، بإجمالي حوالي 5.576 مليون دولار.
- أظهرت التقييمات تفوقه على نماذج أخرى مفتوحة المصدر ومساواته للنماذج المغلقة الرائدة مثل GPT-4o وClaude-3.5-Sonnet.
يشدد التقرير على أن DeepSeek-V3 يحقق أداءً قوياً يقابل النماذج المغلقة من الطراز الأول مع الحفاظ على تكاليف تدريب منخفضة بشكل ملحوظ واستقرار عالٍ.