文章讨论了随着模型改进,增加后训练数据量的边际收益递减,建议转向更高质量的数据集。它突出了 Parsewave,后者结合评估轨迹从现实世界的工程问题中生成后训练数据。
- 一旦模型学会了某种模式,合成数据可能会变得冗余,使得额外的变体用处不大。
- 作者主张使用少量具有清晰 ground truth 和适当审查的具有挑战性、真实的任务。
- 校准任务难度对于避免噪声或缺乏收益至关重要。
- Parsewave 从现实世界的工程问题构建其数据集,而不是仅依赖可扩展性。
讨论质疑了什么使样本值得包含在 SFT/RL/post-training 数据集中,以及针对特定故障模式是否比可扩展性更重要。