DeepSeek ने DeepSeek-V3 जारी किया है, जो एक Mixture-of-Experts (MoE) भाषा मॉडल है जिसमें कुल 671 अरब पैरामीटर हैं और प्रति टोकन 37 अरब सक्रिय हैं। मॉडल को 14.8 ट्रिलियन टोकन पर प्रशिक्षित किया गया है और यह Multi-head Latent Attention और एक सहायक-हानि-मुक्त लोड बैलेंसिंग रणनीति का उपयोग करता है।
- DeepSeek-V3 शीर्ष बंद-स्रोत मॉडलों के तुल्य प्रदर्शन प्राप्त करता है जबकि प्रशिक्षण के लिए केवल 2.788M H800 GPU घंटों की आवश्यकता होती है।
- इसमें एक Multi-Token Prediction (MTP) उद्देश्य शामिल है और यह DeepSeek-R1 श्रृंखला से तर्क क्षमताओं को निचोड़ता है।
- मॉडल Transformers, vLLM, SGLang, और LMDeploy जैसे लाइब्रेरी के माध्यम से इनफरेंस का समर्थन करता है।
यह रिलीज़ गणित और कोड में मजबूत क्षमताओं वाले एक उच्च-प्रदर्शन आधार मॉडल तक ओपन-सोर्स पहुंच प्रदान करती है।