قامت DeepSeek بفتح مصدر DeepSeek-R1، وهو نموذج لغوي كبير تم ضبطه باستخدام التعلم المعزز لتعزيز قدرات الاستدلال. يحقق النموذج نتائج تعادل نتائج OpenAI o1 في معايير مثل MATH-500 و SWE-bench.

  • يعتمد على مزيج الخبراء DeepSeek-V3، ويستخدم Group Relative Policy Optimization (GRPO) للتدريب.
  • تعامل الفريق مع مشاكل "البداية الباردة" للتعلم المعزز عن طريق إضافة ضبط دقيق خاضع للإشراف مع أمثلة لسلسلة التفكير قبل التعلم المعزز.
  • تم إصدار نسخ مُستخلصة لـ Qwen و Llama، متفوقة على نماذج أكبر مثل GPT-4 في مهام الرياضيات والبرمجة.
  • احتل DeepSeek-R1 المرتبة #3 بشكل عام في LMArena بعد فترة قصيرة من الإصدار، متقدماً في فئتي البرمجة والرياضيات.

تسمح الترخيص مفتوح المصدر باستخدام مخرجات النموذج للاستخلاص، مما قد يدفع حالة الفن للأمام لنماذج اللغات بجميع الأحجام.