Pangram Labsによる800の事前学習済み言語モデルの研究により、近年のウェブデータの31%以上を占める「野生」のAI生成ウェブテキストが、人間のテキストを処理することを目的とした場合、モデルのパフォーマンスに悪影響を与えることが明らかになった。この研究は、少量のAIトークンが一時的にはデータ不足のモデルに役立つかも知れないが、その割合が増加するとすぐに害に転じることを示している。
- 人間のテキストに対して高い予算で学習したモデルでは、AIトークンを追加すると損失がほぼ直ちに上昇するのに対し、新鮮な人間のトークンはそれを低下させ続ける。
- 既存のスケーリング法則はこの挙動を予測できない;著者らは、利益項と害項を分離した新たな法則を提案し、既存の方法と比較して予測誤差を41%削減した。
- この研究は、人間を対象としたモデルにはAIテキストをフィルタリングし、AIデータを追加する前に人間のテキストを繰り返すこと、そして検証損失を人間向けテキストとAI向けテキストで別々に報告することを推奨している。
これらの知見は、AIテキストが対象がAIテキストの場合のみ価値があることを示唆しており、人間中心のタスクのためにトレーニングする際にはフィルタリングするか慎重に扱うべきである。著者らは、ラベル付きの83Bトークンのコーパス「WildAI」と、コードおよびモデル重みを公開した。