DeepSeek ने DeepSeek-R1 को ओपन-सोर्स किया है, जो तर्क क्षमताओं को बढ़ाने के लिए पुनर्बल सीखने (reinforcement learning) का उपयोग करके फाइन-ट्यून किया गया एक बड़ा भाषा मॉडल है। मॉडल MATH-500 और SWE-bench जैसे बेंचमार्क पर OpenAI के o1 के बराबर परिणाम प्राप्त करता है।
- विशेषज्ञों के मिश्रण DeepSeek-V3 पर आधारित, यह प्रशिक्षण के लिए Group Relative Policy Optimization (GRPO) का उपयोग करता है।
- टीम ने पुनर्बल सीखने से पहले सोच की श्रृंखला उदाहरणों के साथ निगरानी किया गया फाइन-ट्यूनिंग जोड़कर RL के "कोल्ड स्टार्ट" मुद्दों को संबोधित किया।
- Qwen और Llama के लिए डिस्टिल्ड संस्करण जारी किए गए, जो गणित और कोडिंग कार्यों में GPT-4 जैसे बड़े मॉडल से बेहतर प्रदर्शन करते हैं।
- रिलीज के कुछ समय बाद DeepSeek-R1 ने LMArena में समग्र रूप से #3 स्थान प्राप्त किया, कोडिंग और गणित श्रेणियों में अग्रणी रहा।
ओपन-सोर्स लाइसेंस मॉडल आउटपुट को डिस्टिलेशन के लिए उपयोग करने की अनुमति देता है, जो सभी आकारों के भाषा मॉडल के लिए कला की स्थिति को आगे बढ़ा सकता है।