L'article discute du rendement décroissant de l'augmentation du volume de données de post-apprentissage à mesure que les modèles s'améliorent, suggérant un passage à des ensembles de données de meilleure qualité. Il met en avant Parsewave, qui génère des données de post-apprentissage à partir de problèmes d'ingénierie du monde réel avec des traces d'évaluation.

  • Les données synthétiques peuvent devenir redondantes une fois qu'un modèle a appris un motif, rendant les variations supplémentaires moins utiles.
  • L'auteur plaide pour de petites quantités de tâches difficiles et réalistes avec une ground truth claire et une révision appropriée.
  • Calibrer la difficulté de la tâche est critique pour éviter le bruit ou l'absence d'avantage.
  • Parsewave construit son ensemble de données à partir de problèmes d'ingénierie du monde réel plutôt que de s'appuyer uniquement sur l'évolutivité.

La discussion interroge ce qui rend un échantillon digne d'être inclus dans les ensembles de données SFT/RL/post-apprentissage et si la ciblage de modes d'échec spécifiques est plus important que l'évolutivité.