A Microsoft apresentou o Phi-4-Mini-Reasoning, um modelo compacto de 3,8 bilhões de parâmetros que alcança desempenho superior em raciocínio matemático em comparação com concorrentes significativamente maiores por meio de uma receita de treinamento sistemática de quatro etapas.
A metodologia envolve treinamento intermediário em larga escala em dados de cadeia de pensamento longa distilada, ajuste fino supervisionado, Rollout DPO usando conjuntos de preferência curados e aprendizado por reforço com recompensas verificáveis.
No benchmark Math-500, o Phi-4-Mini-Reasoning supera o DeepSeek-R1-Distill-Qwen-7B em 3,2 pontos e o DeepSeek-R1-Distill-Llama-8B em 7,7 pontos.
Os resultados validam que uma receita de treinamento cuidadosamente projetada com dados de cadeia de pensamento de alta qualidade pode desbloquear fortes capacidades de raciocínio em modelos de linguagem pequenos com recursos limitados.