DeepSeek telah merilis DeepSeek-R1, sebuah model bahasa besar yang dilatih menggunakan pembelajaran penguatan murni untuk meningkatkan kemampuan penalarannya tanpa bergantung pada demonstrasi yang dianotasi oleh manusia.

Model ini menunjukkan pola penalaran canggih yang muncul, termasuk refleksi diri, verifikasi, dan adaptasi strategi dinamis. Model ini mencapai kinerja superior pada tugas-tugas yang dapat diverifikasi dalam matematika, kompetisi pemrograman, dan bidang STEM dibandingkan dengan model yang dilatih melalui pembelajaran terawasi konvensional. Selain itu, pola penalaran yang dikembangkan oleh model skala besar ini dapat digunakan untuk membimbing dan meningkatkan model-model yang lebih kecil.

Pendekatan ini menunjukkan bahwa pembelajaran penguatan saja dapat secara efektif mendorong perilaku penalaran kompleks dalam LLM, mengurangi ketergantungan pada data berlabel manusia yang luas.