DeepSeek telah membuka kode sumber DeepSeek-R1, sebuah model bahasa besar yang dihaluskan menggunakan pembelajaran penguatan untuk meningkatkan kemampuan penalaran. Model ini mencapai hasil yang setara dengan OpenAI o1 pada benchmark seperti MATH-500 dan SWE-bench.
- Berdasarkan campuran ahli DeepSeek-V3, model ini menggunakan Group Relative Policy Optimization (GRPO) untuk pelatihan.
- Tim mengatasi masalah "cold start" RL dengan menambahkan penyesuaian halus terawasi dengan contoh rantai pemikiran sebelum pembelajaran penguatan.
- Versi distilasi untuk Qwen dan Llama dirilis, mengungguli model yang lebih besar seperti GPT-4 dalam tugas matematika dan pemrograman.
- DeepSeek-R1 menempati peringkat #3 secara keseluruhan di LMArena tak lama setelah rilis, memimpin dalam kategori pemrograman dan matematika.
Lisensi sumber terbuka mengizinkan penggunaan keluaran model untuk distilasi, yang berpotensi memajukan keadaan seni untuk model bahasa dari semua ukuran.