DeepSeek ने DeepSeek-V3 जारी किया है, जो एक शक्तिशाली Mixture-of-Experts (MoE) भाषा मॉडल है जिसमें कुल 671B पैरामीटर हैं और प्रति टोकन 37B सक्रिय होते हैं। यह मॉडल Multi-head Latent Attention और सहायक-हानि-मुक्त लोड बैलेंसिंग रणनीति का उपयोग करता है, जिसका प्रशिक्षण FP8 मिक्स्ड प्रिसिशन का उपयोग करके 14.8 ट्रिलियन टोकन पर किया गया।

  • DeepSeek-V3 शीर्ष बंद-स्रोत मॉडलों के तुलनीय प्रदर्शन प्राप्त करता है, जबकि पूर्ण प्रशिक्षण के लिए केवल 2.788M H800 GPU घंटों की आवश्यकता होती है।
  • इस मॉडल में इनफरेंस त्वरण के लिए Multi-Token Prediction (MTP) शामिल है और यह DeepSeek-R1 श्रृंखला से तर्कशक्ति को डिस्टिल करता है।
  • वजन FP8 प्रारूप में प्रदान किए गए हैं, BF16 प्रयोगों के लिए कनवर्शन स्क्रिप्ट उपलब्ध हैं।
  • NVIDIA, AMD और Huawei Ascend हार्डवेयर पर SGLang, vLLM, LMDeploy और TensorRT-LLM जैसे फ्रेमवर्क के माध्यम से स्थानीय तौर पर डिप्लॉयमेंट का समर्थन किया जाता है।

इस रिलीज ने डेवलपर्स के लिए एक कुशल, उच्च-प्रदर्शन वाले ओपन-सोर्स विकल्प प्रदान किया है, जिसमें गणित और कोड कार्यों में इसकी शक्तिशालिता को दर्शाने वाले व्यापक मूल्यांकन परिणाम शामिल हैं।