Microsoft telah memperkenalkan Phi-4-Mini-Reasoning, sebuah model kompak berisi 3,8 miliar parameter yang mencapai kinerja penalaran matematika yang unggul dibandingkan pesaing yang jauh lebih besar melalui resep pelatihan sistematis empat langkah.

Metodologinya melibatkan pelatihan menengah skala besar pada data rantai-pemikiran-panjang yang didistilasi, penyetelan halus terawasi, Rollout DPO menggunakan dataset preferensi yang dikurasi, dan pembelajaran penguatan dengan hadiah yang dapat diverifikasi.

Pada benchmark Math-500, Phi-4-Mini-Reasoning mengungguli DeepSeek-R1-Distill-Qwen-7B sebesar 3,2 poin dan DeepSeek-R1-Distill-Llama-8B sebesar 7,7 poin.

Hasil-hasil tersebut memvalidasi bahwa resep pelatihan yang dirancang dengan cermat dengan data rantai-pemikiran berkualitas tinggi dapat membuka kemampuan penalaran yang kuat pada model bahasa kecil dengan sumber daya terbatas.