微软推出了 Phi-4-Mini-Reasoning,这是一个紧凑的 38 亿参数模型,通过系统性的四步训练配方,在数学推理性能上优于显著更大的竞争对手。
该方法涉及在蒸馏长思维链数据上进行大规模中间训练、监督微调、使用精心策划的偏好数据集进行 Rollout DPO,以及使用可验证奖励的强化学习。
在 Math-500 基准测试中,Phi-4-Mini-Reasoning 比 DeepSeek-R1-Distill-Qwen-7B 高出 3.2 分,比 DeepSeek-R1-Distill-Llama-8B 高出 7.7 分。
结果证实,精心设计的训练配方结合高质量的思维链数据,可以在资源受限的小型语言模型中激发强大的推理能力。