В статье DeepSeekMath представлен открытый языковая модель с 7 миллиардами параметров, предназначенная для улучшения способностей к математическому рассуждению. Модель создана путем продолжения предварительного обучения DeepSeek-Coder-Base-v1.5 на 120 миллиардах токенов, связанных с математикой, из Common Crawl, а также данных естественного языка и кода.
- DeepSeekMath 7B набирает 51,7% на соревновательном бенчмарке MATH без использования внешних инструментов или техник голосования.
- Самосогласованность на 64 выборках достигает 60,9% на бенчмарке MATH.
- Производительность объясняется конвейером курируемого отбора данных и Групповой Относительной Оптимизации Политики (GRPO).
- GRPO является вариантом Проксимальной Оптимизации Политики, который улучшает рассуждение при оптимизации использования памяти.
Авторы считают это значимым, поскольку модель приближается к уровню производительности проприетарных моделей, таких как Gemini-Ultra и GPT-4.