Sebuah studi Pangram Labs mengenai teks web yang dihasilkan AI "liar" mengungkapkan bahwa menambahkan token tersebut ke data pra-pelatihan awalnya menurunkan loss pada teks manusia tetapi dengan cepat berubah menjadi kerugian saat rasionya meningkat. Para peneliti melatih 800 model bahasa untuk menurunkan hukum penskalaan baru yang memperhitungkan dinamika ini, yang gagal diprediksi oleh hukum yang ada seperti Chinchilla.
- Analisis data FineWeb menunjukkan token yang dihasilkan AI meningkat dari 27,5% pada Juni 2026 menjadi 31,1% pada Agustus.
- Untuk model yang kekurangan data, penambahan token AI menurunkan loss teks manusia secara awal tetapi kemudian jenuh dan meningkatkannya.
- Model yang dilatih dengan anggaran tinggi pada teks manusia melihat loss mereka hampir segera meningkat saat menambahkan token AI.
- Hukum penskalaan baru memprediksi loss teks manusia yang dihold-out untuk model hingga 3,6x lebih besar dengan kesalahan 41% lebih rendah dibandingkan hukum yang ada.
Para penulis merekomendasikan pemfilteran teks AI ketika targetnya adalah teks manusia, pengulangan teks manusia sebelum memperluas dataset dengan konten yang dihasilkan AI, dan pelaporan loss validasi pada teks manusia dan AI secara terpisah.