Sebuah panduan mendemonstrasikan fine-tuning model Liquid AI LFM2.5-350M menggunakan Optimisasi Kebijakan Relatif Grup (GRPO) untuk meningkatkan generasi output terstruktur. Prosesnya melibatkan pelatihan pada subset dari dataset NVIDIA Nemotron dan mengevaluasi kinerja melalui benchmark IFStruct.
- Evaluasi baseline model dasar LFM2.5-350M menghasilkan tingkat kelulusan 22,6% pada benchmark IFStruct.
- Pelatihan menggunakan sekitar 500 sampel dengan augmentasi data untuk menyesuaikan dengan distribusi evaluasi.
- Fungsi reward digabungkan untuk memberi skor format JSON, akurasi jumlah bidang, dan validasi skema.
- Model yang telah difine-tuning mencapai tingkat kelulusan keseluruhan 29,7%, mewakili peningkatan signifikan dibandingkan baseline.
Hasilnya menunjukkan bahwa fine-tuning spesifik tugas pada model yang lebih kecil dapat meningkatkan kinerja dan menyamai model yang jauh lebih besar.