माइक्रोसॉफ्ट ने फाई-4-मिनी-रीजनिंग का परिचय दिया, जो 3.8 अरब पैरामीटर वाला एक संक्षिप्त मॉडल है जो एक व्यवस्थित चार-चरण की प्रशिक्षण विधि के माध्यम से महत्वपूर्ण रूप से बड़े प्रतिस्पर्धियों की तुलना में श्रेष्ठ गणितीय तर्क प्रदर्शन प्राप्त करता है।

पद्धति में विलोपित लंबे-थॉट-ऑफ-द-कोस्ट डेटा पर मापनीय मध्यवर्ती प्रशिक्षण, निगरानी फाइन-ट्यूनिंग, चुने हुए प्राथमिकता डेटासेट का उपयोग करके रोलआउट DPO, और सत्यापन योग्य पुरस्कारों के साथ पुनर्बल सीखना शामिल है।

Math-500 बेंचमार्क पर, फाई-4-मिनी-रीजनिंग DeepSeek-R1-Distill-Qwen-7B से 3.2 अंक और DeepSeek-R1-Distill-Llama-8B से 7.7 अंक अधिक है।

परिणाम इस बात की पुष्टि करते हैं कि उच्च-गुणवत्ता वाली थॉट-ऑफ-द-कोस्ट डेटा के साथ सावधानी से डिज़ाइन की गई प्रशिक्षण विधि संसाधन-सीमित छोटे भाषा मॉडलों में मजबूत तर्क क्षमताओं को अनलॉक कर सकती है।