Microsoft a présenté Phi-4-Mini-Reasoning, un modèle compact de 3,8 milliards de paramètres qui atteint des performances supérieures en raisonnement mathématique par rapport à des concurrents significativement plus grands grâce à une recette d'entraînement systématique en quatre étapes.

La méthodologie implique un entraînement intermédiaire à grande échelle sur des données de chaîne de pensée longue distillées, un ajustement fin supervisé, le Rollout DPO utilisant des ensembles de préférences curatés et l'apprentissage par renforcement avec des récompenses vérifiables.

Sur le benchmark Math-500, Phi-4-Mini-Reasoning dépasse DeepSeek-R1-Distill-Qwen-7B de 3,2 points et DeepSeek-R1-Distill-Llama-8B de 7,7 points.

Les résultats valident qu'une recette d'entraînement soigneusement conçue avec des données de chaîne de pensée de haute qualité peut débloquer de fortes capacités de raisonnement dans des modèles de langage petits aux ressources limitées.