Microsoftは、Phi-4-Mini-Reasoningを発表しました。これは38億パラメータのコンパクトなモデルで、体系的な4段階のトレーニングレシピを通じて、大幅に大きな競合モデルよりも優れた数学的推論パフォーマンスを達成しています。
この手法には、蒸留された長い思考連鎖データの大規模な中間トレーニング、教師ありファインチューニング、キュレーションされた好意データセットを使用したRollout DPO、および検証可能な報酬を用いた強化学習が含まれます。
Math-500ベンチマークでは、Phi-4-Mini-ReasoningはDeepSeek-R1-Distill-Qwen-7Bより3.2ポイント、DeepSeek-R1-Distill-Llama-8Bより7.7ポイント上回っています。
これらの結果は、高品質な思考連鎖データを用いて慎重に設計されたトレーニングレシピが、リソース制約のある小規模言語モデルでも強力な推論能力を引き出すことができることを裏付けています。