Microsoft는 체계적인 4단계 학습 레시피를 통해 훨씬 더 큰 경쟁사보다 우수한 수학 추론 성능을 달성하는 컴팩트한 38억 파라미터 모델인 Phi-4-Mini-Reasoning을 선보였습니다.

이 방법론에는 증류된 긴 사고 사슬(long-chain-of-thought) 데이터에 대한 대규모 중간 학습, 지도 미세 조정, 선별된 선호도 데이터셋을 사용한 Rollout DPO, 그리고 검증 가능한 보상을 사용한 강화 학습이 포함됩니다.

Math-500 벤치마크에서 Phi-4-Mini-Reasoning은 DeepSeek-R1-Distill-Qwen-7B보다 3.2점, DeepSeek-R1-Distill-Llama-8B보다 7.7점 더 높습니다.

이 결과는 고품질 사고 사슬 데이터를 사용한 신중하게 설계된 학습 레시피가 자원 제약이 있는 소형 언어 모델에서 강력한 추론 능력을 발휘할 수 있음을 검증합니다.