A DeepSeek abriu o código-fonte do DeepSeek-R1, um grande modelo de linguagem ajustado por meio de aprendizado por reforço para aprimorar as capacidades de raciocínio. O modelo alcança resultados equivalentes aos da OpenAI o1 em benchmarks como MATH-500 e SWE-bench.

  • Baseado na mistura de especialistas DeepSeek-V3, ele usa Group Relative Policy Optimization (GRPO) para treinamento.
  • A equipe abordou os problemas de "início a frio" do RL adicionando ajuste fino supervisionado com exemplos de cadeia de pensamento antes do aprendizado por reforço.
  • Versões destiladas para Qwen e Llama foram lançadas, superando modelos maiores como GPT-4 em tarefas de matemática e codificação.
  • DeepSeek-R1 ficou em #3 no geral na LMArena logo após o lançamento, liderando nas categorias de codificação e matemática.

A licença de código aberto permite usar as saídas do modelo para destilação, potencialmente avançando o estado da arte para modelos de linguagem de todos os tamanhos.