Microsoft представила Phi-4-Mini-Reasoning, компактную модель с 3,8 миллиарда параметров, которая демонстрирует превосходные результаты в математических рассуждениях по сравнению с значительно более крупными конкурентами благодаря системному четырехэтапному процессу обучения.

Методология включает масштабное промежуточное обучение на дистиллированных данных длинных цепочек рассуждений (long-chain-of-thought), контролируемое тонкое дообучение, Rollout DPO с использованием курируемых наборов предпочтений и обучение с подкреплением с верифицируемыми наградами.

На бенчмарке Math-500 Phi-4-Mini-Reasoning превосходит DeepSeek-R1-Distill-Qwen-7B на 3,2 балла и DeepSeek-R1-Distill-Llama-8B на 7,7 балла.

Результаты подтверждают, что тщательно разработанный процесс обучения с высококачественными данными цепочки рассуждений может раскрыть сильные способности к рассуждению в малых языковых моделях с ограниченными ресурсами.