Pangram Labsによる「野生」のAI生成ウェブテキストの研究は、そのようなトークンを事前学習データに追加すると、最初は人間用のテキストに対する損失が低下するが、比率が増加するにつれてすぐに害へと転じることを明らかにした。研究者たちは800個の言語モデルを事前学習させてこの動態を考慮した新しいスケーリング則を導き出し、Chinchillaのような既存の則では予測できないことを示した。

  • FineWebデータの分析によると、AI生成トークンの割合は2026年6月の27.5%から8月には31.1%に増加した。
  • データ不足のモデルでは、追加されたAIトークンは人間用テキストの損失を最初に低下させるが、飽和した後でそれを増加させる。
  • 大量の人間用テキストに対して高い予算で訓練されたモデルは、AIトークンを追加するとすぐに損失が増加する傾向にある。
  • 新しいスケーリング則は、既存の則と比較して41%低い誤差で、最大3.6倍大きいモデルの保持された人間用テキストの損失を予測する。

著者たちは、対象が人間用テキストである場合にAIテキストをフィルタリングすること、AI生成コンテンツを含むデータセットを展開する前に人間用テキストを繰り返すこと、そして人間用テキストとAIテキストに対して検証損失を別々に報告することを推奨している。