この記事では、モデルが改善するにつれてポストトレーニングデータの量を増やすことの限界効用逓減について議論し、より高品質なデータセットへの移行を提案しています。Parsewaveは、評価トレースとともに現実世界のエンジニアリング問題からポストトレーニングデータを生成することを強調しています。
- モデルがパターンを学習すると、合成データは冗長になる可能性があり、追加のバリエーションはあまり有用でなくなります。
- 著者は、明確なground truthと適切なレビューを持つ、挑战性のある現実的なタスクの小規模なセットを支持しています。
- ノイズや利益の欠如を避けるために、タスクの難易度をキャリブレーションすることが重要です。
- Parsewaveはスケーラビリティに依存するのではなく、現実世界のエンジニアリング問題からデータセットを構築します。
議論では、SFT/RL/ポストトレーニングデータセットへの含値に値するサンプルとは何か、そしてスケーラビリティよりも特定の失敗モードを対象とすることがより重要かどうかについて問われています。