DeepSeek ने DeepSeek-R1 जारी किया है, जो एक बड़ी भाषा मॉडल है जिसे मानव-अनोटेटेड डेमोस्ट्रेशन पर निर्भर किए बिना अपने तर्क क्षमताओं को बढ़ाने के लिए शुद्ध प्रबल सीखने का उपयोग करके प्रशिक्षित किया गया है।
मॉडल में आत्म-प्रतिबिंब, सत्यापन और गतिशील रणनीति अनुकूलन सहित उत्पन्न उन्नत तर्क पैटर्न दिखाई देते हैं। यह गणित, कोडिंग प्रतियोगिताओं और STEM क्षेत्रों में जाँच योग्य कार्यों पर पारंपरिक निगरानी सीखने के माध्यम से प्रशिक्षित मॉडलों की तुलना में श्रेष्ठ प्रदर्शन प्राप्त करता है। इसके अलावा, इस बड़े पैमाने पर मॉडल द्वारा विकसित तर्क पैटर्न का उपयोग छोटे मॉडलों को निर्देशित और सुधारने के लिए किया जा सकता है।
यह दृष्टिकोण दिखाता है कि प्रबल सीखना अकेले LLMs में जटिल तर्क व्यवहारों को प्रभावी ढंग से प्रोत्साहित कर सकता है, जिससे विस्तृत मानव-लेबल वाले डेटा पर निर्भरता कम होती है।