この記事では、モデルが改善するにつれてポストトレーニングデータの量を増やすことの限界効用逓減について議論し、より高品質なデータセットへの移行を提案しています。Parsewaveは、評価トレースとともに現実世界のエンジニアリング問題からポストトレーニングデータを生成することを強調しています。

  • モデルがパターンを学習すると、合成データは冗長になる可能性があり、追加のバリエーションはあまり有用でなくなります。
  • 著者は、明確なground truthと適切なレビューを持つ、挑战性のある現実的なタスクの小規模なセットを支持しています。
  • ノイズや利益の欠如を避けるために、タスクの難易度をキャリブレーションすることが重要です。
  • Parsewaveはスケーラビリティに依存するのではなく、現実世界のエンジニアリング問題からデータセットを構築します。

議論では、SFT/RL/ポストトレーニングデータセットへの含値に値するサンプルとは何か、そしてスケーラビリティよりも特定の失敗モードを対象とすることがより重要かどうかについて問われています。