Pangram Labs对“野生”AI生成的网页文本的研究表明,将这些token添加到预训练数据中最初会降低人类文本的损失,但随着比例增加,这种影响会迅速逆转并造成损害。研究人员预训练了800个语言模型以推导出一种新的缩放定律,该定律考虑了这一动态变化,而现有的Chinchilla等定律无法预测这一点。
- 对FineWeb数据的分析显示,AI生成的token占比从2026年6月的27.5%上升至8月的31.1%。
- 对于数据匮乏的模型,添加AI token最初会降低人类文本的损失,但随后会饱和并导致损失增加。
- 在大量人类文本上训练的模型,在添加AI token后其损失几乎立即上升。
- 新的缩放定律预测保留的人类文本损失,对于规模达3.6倍的模型,其误差比现有定律低41%。
作者建议在目标为人类文本时过滤AI文本,在通过AI生成内容扩展数据集之前重复人类文本,并分别报告人类文本和AI文本的验证损失。