DeepSeekMath 论文介绍了一个拥有 70 亿参数的开源语言模型,旨在增强数学推理能力。该模型通过继续使用来自 Common Crawl 的 1200 亿个与数学相关的 token,以及自然语言和代码数据,对 DeepSeek-Coder-Base-v1.5 进行预训练延续而创建。
- DeepSeekMath 7B 在竞赛级 MATH 基准测试中取得 51.7% 的成绩,无需外部工具包或投票技术。
- 在 MATH 基准测试上,64 个样本的自我一致性达到 60.9%。
- 性能归因于精选的数据选择管道和组相对策略优化(GRPO)。
- GRPO 是近端策略优化的一种变体,它在优化内存使用的同时提升了推理能力。
作者认为这具有重要意义,因为该模型的性能水平已接近 Gemini-Ultra 和 GPT-4 等专有模型。