O artigo DeepSeekMath apresenta um modelo de linguagem aberto com 7B de parâmetros projetado para aprimorar as capacidades de raciocínio matemático. O modelo é criado continuando o pré-treinamento do DeepSeek-Coder-Base-v1.5 com 120B de tokens relacionados a matemática do Common Crawl, junto com dados de linguagem natural e código.

  • DeepSeekMath 7B pontua 51,7% no benchmark MATH de nível competitivo sem kits de ferramentas externos ou técnicas de votação.
  • A consistência interna sobre 64 amostras atinge 60,9% no benchmark MATH.
  • O desempenho é atribuído a um pipeline curado de seleção de dados e Otimização Relativa de Política em Grupo (GRPO).
  • GRPO é uma variante da Otimização de Política Próxima que melhora o raciocínio enquanto otimiza o uso de memória.

Os autores consideram isso significativo porque o modelo se aproxima do nível de desempenho de modelos proprietários como Gemini-Ultra e GPT-4.