أطلقت DeepSeek نموذج DeepSeek-R1، وهو نموذج لغوي كبير تم تدريبه باستخدام التعلم المعزز النقي لتعزيز قدراته على الاستدلال دون الاعتماد على عروض توضيحية مُعلَّمة من قبل البشر.

يعرض النموذج أنماط استدلال متقدمة ناشئة، بما في ذلك التأمل الذاتي، والتحقق، والتكيف الديناميكي للاستراتيجيات. يحقق أداءً فائقًا في المهام القابلة للتحقق في الرياضيات، ومسابقات البرمجة، ومجالات العلوم والتكنولوجيا والهندسة والرياضيات مقارنة بالنماذج المدربة عبر التعلم الخاضع للإشراف التقليدي. بالإضافة إلى ذلك، يمكن استخدام أنماط الاستدلال التي طورها هذا النموذج واسع النطاق لتوجيه وتحسين النماذج الأصغر.

يُظهر هذا النهج أن التعلم المعزز وحده يمكنه تحفيز سلوكيات الاستدلال المعقدة في نماذج اللغات الكبيرة بشكل فعال، مما يقلل الاعتماد على البيانات الواسعة المُعلَّمة من قبل البشر.