DeepSeek-AI ने DeepSeek-V3 प्रस्तुत किया है, जो एक शक्तिशाली मिक्स्चर-ऑफ-एक्सपर्ट्स भाषा मॉडल है जिसमें कुल 671B पैरामीटर और प्रति टोकन 37B सक्रिय हैं। मॉडल कुशल इनफरेंस और लागत-प्रभावी प्रशिक्षण प्राप्त करने के लिए मल्टी-हेड लेटेंट एटेंशन और DeepSeekMoE आर्किटेक्चर अपनाता है।
- DeepSeek-V3 लोड बैलेंसिंग के लिए सहायक-हानि-मुक्त रणनीति का अग्रणी है ताकि प्रदर्शन में गिरावट को न्यूनतम किया जा सके।
- यह समग्र बेंचमार्क प्रदर्शन को बढ़ाने के लिए मल्टी-टोकन प्रिडिक्शन ट्रेनिंग ऑब्जेक्टिव का उपयोग करता है।
- टीम ने एक अत्यंत विशाल पैमाने वाले मॉडल पर FP8 मिक्स्ड प्रिसीजन ट्रेनिंग को पहली बार सत्यापित किया।
- प्रशिक्षण में 14.8 ट्रिलियन टोकन का उपयोग किया गया और केवल 2.788M H800 GPU घंटे खर्च हुए, जो लगभग $5.576 मिलियन के बराबर है।
- मूल्यांकन दिखाते हैं कि यह अन्य ओपन-सोर्स मॉडलों को पछाड़ता है और GPT-4o और Claude-3.5-Sonnet जैसे अग्रणी क्लोज्ड-सोर्स मॉडलों के बराबर प्रदर्शन करता है।
रिपोर्ट पर जोर दिया गया है कि DeepSeek-V3 शीर्ष स्तर के क्लोज्ड-सोर्स मॉडलों के तुलनीय मजबूत प्रदर्शन प्राप्त करता है, जबकि उल्लेखनीय रूप से कम प्रशिक्षण लागत और स्थिरता बनाए रखता है।