يوضح دليل ضبط نموذج Liquid AI LFM2.5-350M الدقيق باستخدام تحسين السياسة النسبية للمجموعة (GRPO) لتعزيز توليد المخرجات المهيكلة. تتضمن العملية التدريب على مجموعة فرعية من مجموعة بيانات NVIDIA Nemotron وتقييم الأداء عبر معيار IFStruct.
- أظهر تقييم النموذج الأساسي LFM2.5-350معدل نجاح بنسبة 22.6% في معيار IFStruct.
- استخدم التدريب حوالي 500 عينة مع زيادة البيانات لمواءمة التوزيع مع التقييم.
- تم دمج وظائف المكافأة لتقييم تنسيق JSON ودقة عدد الحقول والتحقق من صحة المخطط.
- حقق النموذج المضبوط بدقة معدل نجاح إجمالي بنسبة 29.7%، مما يمثل تحسناً كبيراً مقارنةً بالمعيار الأساسي.
تُظهر النتائج أن الضبط الدقيق المحدد للمهمة للنماذج الأصغر يمكن أن يحسن الأداء ويساوي أداء النماذج الأكبر حجماً بكثير.