本指南演示了如何使用组相对策略优化(GRPO)对 Liquid AI LFM2.5-350M 模型进行微调,以增强结构化输出生成。该过程涉及在 NVIDIA Nemotron 数据集的子集上进行训练,并通过 IFStruct 基准测试评估性能。
- 基础 LFM2.5-350M 模型的基线评估在 IFStruct 基准测试中获得了 22.6% 的通过率。
- 训练使用了大约 500 个样本,并进行了数据增强以匹配评估分布。
- 奖励函数被组合起来用于评分 JSON 格式、字段计数准确性和模式验证。
- 微调后的模型实现了 29.7% 的整体通过率,相较于基线有显著改进。
结果表明,针对较小模型的特定任务微调可以提高性能,并达到远大于其规模的模型的水平。