가이드는 구조화된 출력 생성을 향상시키기 위해 Liquid AI LFM2.5-350M 모델을 그룹 상대 정책 최적화(GRPO)로 파인튜닝하는 방법을 시연합니다. 이 과정에는 NVIDIA Nemotron 데이터셋의 하위 집합에서 훈련하고 IFStruct 벤치마크를 통해 성능을 평가하는 것이 포함됩니다.
- 기본 LFM2.5-350M 모델의 베이스라인 평가는 IFStruct 벤치마크에서 22.6%의 통과율을 보였습니다.
- 훈련은 평가 분포와 일치시키기 위해 데이터 증강과 함께 약 500개의 샘플을 사용했습니다.
- 보상 함수는 JSON 형식, 필드 수 정확도 및 스키마 유효성 검사를 점수화하기 위해 결합되었습니다.
- 파인튜닝된 모델은 전체 통과율 29.7%를 달성하여 베이스라인 대비 상당한 개선을 나타냈습니다.
결과들은 작은 모델의 작업 특화 파인튜닝이 성능을 향상시키고 훨씬 더 큰 모델과 맞먹는 성능을 낼 수 있음을 보여줍니다.