Microsoft ha presentado Phi-4-Mini-Reasoning, un modelo compacto de 3.800 millones de parámetros que logra un rendimiento superior en razonamiento matemático en comparación con competidores significativamente más grandes mediante una receta de entrenamiento sistemática de cuatro pasos.

La metodología implica entrenamiento intermedio a gran escala en datos de cadena de pensamiento larga distilada, ajuste fino supervisado, Rollout DPO utilizando conjuntos de preferencia curados y aprendizaje por refuerzo con recompensas verificables.

En la prueba Math-500, Phi-4-Mini-Reasoning supera a DeepSeek-R1-Distill-Qwen-7B por 3,2 puntos y a DeepSeek-R1-Distill-Llama-8B por 7,7 puntos.

Los resultados validan que una receta de entrenamiento cuidadosamente diseñada con datos de cadena de pensamiento de alta calidad puede desbloquear fuertes capacidades de razonamiento en modelos de lenguaje pequeños con recursos limitados.