DeepSeekMath 논문은 수학적 추론 능력을 향상시키기 위해 설계된 7B 파라미터 오픈 언어 모델을 소개합니다. 이 모델은 Common Crawl의 120B 수학 관련 토큰과 자연어 및 코드 데이터와 함께 DeepSeek-Coder-Base-v1.5의 사전 훈련을 계속하여 생성됩니다.
- DeepSeekMath 7B는 외부 도구킷이나 투표 기법 없이 경쟁 수준 MATH 벤치마크에서 51.7%를 기록했습니다.
- MATH 벤치마크에서 64개 샘플에 대한 자기 일관성은 60.9%에 도달합니다.
- 이 성능은 선별된 데이터 선택 파이프라인과 그룹 상대 정책 최적화(GRPO) 덕분입니다.
- GRPO는 메모리 사용을 최적화하면서 추론을 개선하는 근접 정책 최적화의 변형입니다.
저자들은 이 모델이 Gemini-Ultra와 GPT-4와 같은 독점 모델의 성능 수준에 근접하고 있기 때문에 이를 중요하게 생각합니다.