L'article DeepSeekMath présente un modèle de langage ouvert de 7 milliards de paramètres conçu pour améliorer les capacités de raisonnement mathématique. Le modèle est créé en poursuivant le pré-entraînement de DeepSeek-Coder-Base-v1.5 avec 120 milliards de tokens liés aux mathématiques de Common Crawl, ainsi que des données de langage naturel et de code.
- DeepSeekMath 7B obtient 51,7 % sur le benchmark MATH de niveau compétition sans outils externes ni techniques de vote.
- La cohérence interne sur 64 échantillons atteint 60,9 % sur le benchmark MATH.
- La performance est attribuée à un pipeline de sélection de données curatées et à l'Optimisation Relative de Politique de Groupe (GRPO).
- GRPO est une variante de l'Optimisation de Politique Proximale qui améliore le raisonnement tout en optimisant l'utilisation de la mémoire.
Les auteurs considèrent cela comme significatif car le modèle approche le niveau de performance des modèles propriétaires tels que Gemini-Ultra et GPT-4.