يوضح دليل ضبط نموذج Liquid AI LFM2.5-350M الدقيق باستخدام تحسين السياسة النسبية للمجموعة (GRPO) لتعزيز توليد المخرجات المهيكلة. تتضمن العملية التدريب على مجموعة فرعية من مجموعة بيانات NVIDIA Nemotron وتقييم الأداء عبر معيار IFStruct.

  • أظهر تقييم النموذج الأساسي LFM2.5-350معدل نجاح بنسبة 22.6% في معيار IFStruct.
  • استخدم التدريب حوالي 500 عينة مع زيادة البيانات لمواءمة التوزيع مع التقييم.
  • تم دمج وظائف المكافأة لتقييم تنسيق JSON ودقة عدد الحقول والتحقق من صحة المخطط.
  • حقق النموذج المضبوط بدقة معدل نجاح إجمالي بنسبة 29.7%، مما يمثل تحسناً كبيراً مقارنةً بالمعيار الأساسي.

تُظهر النتائج أن الضبط الدقيق المحدد للمهمة للنماذج الأصغر يمكن أن يحسن الأداء ويساوي أداء النماذج الأكبر حجماً بكثير.