أعلنت مايكروسوفت عن إطلاق Phi-4-Mini-Reasoning، وهو نموذج مضغوط يحتوي على 3.8 مليار معلمة، يحقق أداءً متفوقًا في الاستدلال الرياضي مقارنة بالمنافسين الأكبر حجمًا بشكل ملحوظ من خلال وصفة تدريب منهجية مكونة من أربع خطوات.
تشمل المنهجية التدريب الوسيط واسع النطاق على بيانات سلسلة التفكير الطويلة المُقطَّرة، والضبط الدقيق الخاضع للإشراف، و Rollout DPO باستخدام مجموعات تفضيلات مختارة بعناية، والتعلم المعزز مع مكافآت قابلة للتحقق.
في معيار Math-500، يتفوق Phi-4-Mini-Reasoning على DeepSeek-R1-Distill-Qwen-7B بمقدار 3.2 نقطة وعلى DeepSeek-R1-Distill-Llama-8B بمقدار 7.7 نقطة.
تؤكد النتائج أن وصفة تدريب مصممة بعناية باستخدام بيانات سلسلة تفكير عالية الجودة يمكنها إطلاق قدرات استدلال قوية في نماذج لغوية صغيرة محدودة الموارد.