ガイドでは、構造化出力生成を強化するために、Liquid AI LFM2.5-350Mモデルをグループ相対ポリシー最適化(GRPO)を使用してファインチューニングする方法が示されています。このプロセスには、NVIDIA Nemotronデータセットのサブセットでのトレーニングと、IFStructベンチマークを通じたパフォーマンス評価が含まれます。
- ベースラインのLFM2.5-350Mモデルの評価では、IFStructベンチマークで22.6%のパス率を達成しました。
- トレーニングには、評価分布に合わせるためにデータ拡張を用いた約500個のサンプルが使用されました。
- 報酬関数は、JSON形式、フィールド数の正確さ、スキーマ検証をスコアリングするために組み合わせられました。
- ファインチューニングされたモデルは29.7%の総合パス率を達成し、ベースラインと比較して大幅な改善を示しました。
結果は、小規模モデルのタスク固有のファインチューニングがパフォーマンスを向上させ、はるかに大規模なモデルに匹敵する性能を発揮できることを示しています。