이 기사는 모델이 개선됨에 따라 사후 학습 데이터 양을 증가시키는 한계 수익 감소에 대해 논의하며, 더 높은 품질의 데이터셋으로의 전환을 제안합니다. 이는 평가 트레이스와 함께 현실 세계의 엔지니어링 문제에서 사후 학습 데이터를 생성하는 Parsewave를 강조합니다.
- 모델이 패턴을 학습하면 합성 데이터가 중복될 수 있어 추가 변형은 덜 유용해집니다.
- 저자는 명확한 ground truth와 적절한 검토가 있는 도전적이고 현실적인 작업의 소량을 지지합니다.
- 노이즈 또는 혜택 부재를 피하기 위해 작업 난이도를 보정하는 것이 중요합니다.
- Parsewave는 확장성에만 의존하는 대신 현실 세계의 엔지니어링 문제에서 데이터셋을 구축합니다.
이 논의는 SFT/RL/사후 학습 데이터셋에 포함될 가치가 있는 샘플이 무엇인지, 그리고 확장성보다 특정 실패 모드를 타겟팅하는 것이 더 중요한지 묻습니다.