Sebuah studi Pangram Labs terhadap 800 model bahasa yang telah dilatih sebelumnya mengungkapkan bahwa teks web yang dihasilkan AI "liar", yang kini mencakup lebih dari 31% dari data web terbaru, berdampak negatif pada kinerja model ketika tujuannya adalah memproses teks manusia. Penelitian ini menunjukkan bahwa meskipun jumlah kecil token AI dapat membantu model yang kekurangan data pada awalnya, dampaknya dengan cepat berubah menjadi merugikan seiring meningkatnya proporsinya.
- Untuk model yang dilatih dengan anggaran tinggi menggunakan teks manusia, penambahan token AI meningkatkan loss hampir segera, sedangkan token manusia baru terus menurunkannya.
- Hukum penskalaan yang ada gagal memprediksi perilaku ini; para penulis mengusulkan hukum baru dengan istilah manfaat dan kerugian terpisah yang mengurangi kesalahan prediksi sebesar 41% dibandingkan metode yang ada.
- Studi ini merekomendasikan penyaringan teks AI untuk model yang ditargetkan pada manusia, pengulangan teks manusia sebelum menambahkan data AI, serta pelaporan validation loss pada teks manusia dan teks AI secara terpisah.
Temuan ini menunjukkan bahwa teks AI hanya bernilai ketika targetnya adalah teks AI, tetapi harus difilter atau ditangani dengan hati-hati saat melatih untuk tugas yang berpusat pada manusia. Para penulis merilis WildAI, sebuah korpus berukuran 83B-token dengan label, bersama kode dan bobot model.