文章讨论了随着模型改进,增加后训练数据量的边际收益递减,建议转向更高质量的数据集。它突出了 Parsewave,后者结合评估轨迹从现实世界的工程问题中生成后训练数据。

  • 一旦模型学会了某种模式,合成数据可能会变得冗余,使得额外的变体用处不大。
  • 作者主张使用少量具有清晰 ground truth 和适当审查的具有挑战性、真实的任务。
  • 校准任务难度对于避免噪声或缺乏收益至关重要。
  • Parsewave 从现实世界的工程问题构建其数据集,而不是仅依赖可扩展性。

讨论质疑了什么使样本值得包含在 SFT/RL/post-training 数据集中,以及针对特定故障模式是否比可扩展性更重要。