Un guide démontre le fine-tuning du modèle Liquid AI LFM2.5-350M en utilisant l'Optimisation Relative de Politique de Groupe (GRPO) pour améliorer la génération de sorties structurées. Le processus implique l'entraînement sur un sous-ensemble du jeu de données NVIDIA Nemotron et l'évaluation des performances via le benchmark IFStruct.
- L'évaluation initiale du modèle de base LFM2.5-350M a donné un taux de réussite de 22,6 % sur le benchmark IFStruct.
- L'entraînement a utilisé environ 500 échantillons avec augmentation de données pour s'aligner sur la distribution d'évaluation.
- Les fonctions de récompense ont été combinées pour noter le format JSON, la précision du nombre de champs et la validation du schéma.
- Le modèle fine-tuné a atteint un taux de réussite global de 29,7 %, représentant une amélioration significative par rapport à la ligne de base.
Les résultats montrent que le fine-tuning spécifique à la tâche des modèles plus petits peut améliorer les performances et égaler celles de modèles beaucoup plus grands.