El artículo de DeepSeekMath presenta un modelo de lenguaje abierto de 7B parámetros diseñado para mejorar las capacidades de razonamiento matemático. El modelo se crea continuando el preentrenamiento de DeepSeek-Coder-Base-v1.5 con 120B tokens relacionados con matemáticas de Common Crawl, junto con datos de lenguaje natural y código.
- DeepSeekMath 7B obtiene un 51,7% en el benchmark MATH a nivel competitivo sin kits de herramientas externos ni técnicas de votación.
- La consistencia interna sobre 64 muestras alcanza el 60,9% en el benchmark MATH.
- El rendimiento se atribuye a una canalización curada de selección de datos y Optimización Relativa de Política Grupal (GRPO).
- GRPO es una variante de la Optimización de Política Proximaria que mejora el razonamiento mientras optimiza el uso de memoria.
Los autores consideran esto significativo porque el modelo se acerca al nivel de rendimiento de modelos propietarios como Gemini-Ultra y GPT-4.