DeepSeekMath पेपर में गणितीय तर्क क्षमताओं को बढ़ाने के लिए डिज़ाइन किए गए 7B पैरामीटर वाले ओपन लैंग्वेज मॉडल का परिचय दिया गया है। मॉडल को Common Crawl से 120B गणितीय-संबंधित टोकन, प्राकृतिक भाषा और कोड डेटा के साथ DeepSeek-Coder-Base-v1.5 के पूर्व-प्रशिक्षण को जारी रखकर बनाया गया है।
- DeepSeekMath 7B ने बाहरी टूलकिट या वोटिंग तकनीकों के बिना प्रतिस्पर्धा-स्तरीय MATH बेंचमार्क पर 51.7% स्कोर किया।
- MATH बेंचमार्क पर 64 नमूनों पर स्व-संगति (self-consistency) 60.9% तक पहुंचती है।
- प्रदर्शन को चयनित डेटा चयन पाइपलाइन और ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) के लिए जिम्मेदार ठहराया गया है।
- GRPO प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन का एक प्रकार है जो मेमोरी उपयोग को अनुकूलित करते हुए तर्क में सुधार करता है।
लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि मॉडल Gemini-Ultra और GPT-4 जैसे प्रोप्राइटरी मॉडलों के प्रदर्शन स्तर के करीब पहुंच रहा है।