تقدم DeepSeek-AI نموذج DeepSeek-V3، وهو نموذج لغوي قوي من نوع Mixture-of-Experts يحتوي على 671B معلمة إجمالاً و37B مُفعّلة لكل توكن. يعتمد النموذج على بنية Multi-head Latent Attention وDeepSeekMoE لتحقيق استنتاج فعال وتدريب ميسور التكلفة.

  • يُعد DeepSeek-V3 رائداً في استراتيجية موازنة الأحمال خالية من الخسارة المساعدة لتقليل تدهور الأداء.
  • يستخدم هدف تدريب متعدد التوقعات للتوكنات لتعزيز أداء المعايير الشاملة.
  • قام الفريق بتأكيد صحة التدريب بدقة مختلطة FP8 على نموذج ضخم النطاق لأول مرة.
  • استغل التدريب 14.8 تريليون توكن وتكلف فقط 2.788 مليون ساعة من وحدات معالجة الرسومات H800، بإجمالي حوالي 5.576 مليون دولار.
  • أظهرت التقييمات تفوقه على نماذج أخرى مفتوحة المصدر ومساواته للنماذج المغلقة الرائدة مثل GPT-4o وClaude-3.5-Sonnet.

يشدد التقرير على أن DeepSeek-V3 يحقق أداءً قوياً يقابل النماذج المغلقة من الطراز الأول مع الحفاظ على تكاليف تدريب منخفضة بشكل ملحوظ واستقرار عالٍ.