A DeepSeek abriu o código-fonte do DeepSeek-R1, um grande modelo de linguagem ajustado por meio de aprendizado por reforço para aprimorar as capacidades de raciocínio. O modelo alcança resultados equivalentes aos da OpenAI o1 em benchmarks como MATH-500 e SWE-bench.
- Baseado na mistura de especialistas DeepSeek-V3, ele usa Group Relative Policy Optimization (GRPO) para treinamento.
- A equipe abordou os problemas de "início a frio" do RL adicionando ajuste fino supervisionado com exemplos de cadeia de pensamento antes do aprendizado por reforço.
- Versões destiladas para Qwen e Llama foram lançadas, superando modelos maiores como GPT-4 em tarefas de matemática e codificação.
- DeepSeek-R1 ficou em #3 no geral na LMArena logo após o lançamento, liderando nas categorias de codificação e matemática.
A licença de código aberto permite usar as saídas do modelo para destilação, potencialmente avançando o estado da arte para modelos de linguagem de todos os tamanhos.