एक गाइड GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन) का उपयोग करके Liquid AI LFM2.5-350M मॉडल के फाइन-ट्यूनिंग को प्रदर्शित करता है ताकि संरचित आउटपुट जनरेशन में सुधार किया जा सके। इस प्रक्रिया में NVIDIA Nemotron डेटासेट के एक उपसमुच्चय पर प्रशिक्षण और IFStruct बेंचमार्क के माध्यम से प्रदर्शन का मूल्यांकन शामिल है।
- बेसलाइन LFM2.5-350M मॉडल का बेसलाइन मूल्यांकन IFStruct बेंचमार्क पर 22.6% पास दर देता है।
- प्रशिक्षण में मूल्यांकन वितरण के साथ अनुकूलन के लिए डेटा ऑगमेंटेशन के साथ लगभग 500 नमूनों का उपयोग किया गया।
- JSON प्रारूप, फ़ील्ड गिनती सटीकता और स्कीमा वैलिडेशन को स्कोर करने के लिए रिवार्ड फंक्शंस को संयोजित किया गया।
- फाइन-ट्यून्ड मॉडल ने 29.7% की समग्र पास दर हासिल की, जो बेसलाइन की तुलना में एक महत्वपूर्ण सुधार है।
परिणाम दिखाते हैं कि छोटे मॉडल्स का टास्क-विशिष्ट फाइन-ट्यूनिंग प्रदर्शन को बेहतर बना सकता है और बहुत बड़े मॉडल्स के समान हो सकता है।