A DeepSeek lançou o DeepSeek-R1, um modelo de linguagem grande treinado usando aprendizado por reforço puro para aprimorar suas capacidades de raciocínio sem depender de demonstrações anotadas por humanos.
O modelo exibe padrões avançados de raciocínio emergentes, incluindo autorreflexão, verificação e adaptação dinâmica de estratégias. Ele alcança desempenho superior em tarefas verificáveis em matemática, competições de programação e áreas STEM em comparação com modelos treinados por meio de aprendizado supervisionado convencional. Além disso, os padrões de raciocínio desenvolvidos por este modelo em larga escala podem ser usados para orientar e melhorar modelos menores.
Esta abordagem demonstra que o aprendizado por reforço sozinho pode incentificar eficazmente comportamentos complexos de raciocínio em LLMs, reduzindo a dependência de dados extensamente rotulados por humanos.