800 प्री-ट्रेन्ड भाषा मॉडल्स पर एक पैंग्राम लैब्स अध्ययन से पता चलता है कि "अराजक" एआई-जनित वेब टेक्स्ट, जो अब हालिया वेब डेटा का 31% से अधिक हिस्सा बनाता है, मॉडल की प्रदर्शन को नकारात्मक रूप से प्रभावित करता है जब लक्ष्य मानव टेक्स्ट को प्रोसेस करना होता है। शोध दिखाता है कि हालांकि छोटी मात्रा में एआई टोकन शुरू में डेटा-भूखे मॉडल्स की मदद कर सकते हैं, लेकिन उनकी मात्रा बढ़ने के साथ वे जल्दी ही हानि में बदल जाते हैं।
- उच्च बजट वाले मानव टेक्स्ट पर प्रशिक्षित मॉडल्स के लिए, एआई टोकन जोड़ने से नुकसान तुरंत बढ़ जाता है, जबकि ताजे मानव टोकन उसे कम करते रहते हैं।
- मौजूदा स्केलिंग नियम इस व्यवहार की भविष्यवाणी करने में विफल रहते हैं; लेखकों ने एक नया नियम प्रस्तावित किया है जिसमें अलग-अलग लाभ और हानि पद शामिल हैं, जो मौजूदा तरीकों की तुलना में भविष्यवाणी त्रुटि को 41% कम करता है।
- अध्ययन मानव-लक्षित मॉडल्स के लिए एआई टेक्स्ट को फ़िल्टर करने, एआई डेटा जोड़ने से पहले मानव टेक्स्ट को दोहराने और मानव और एआई टेक्स्ट पर वैलिडेशन नुकसान को अलग-अलग रिपोर्ट करने की सलाह देता है।
निष्कर्ष सुझाते हैं कि एआई टेक्स्ट तभी तक मूल्यवान रहता है जब लक्ष्य एआई टेक्स्ट हो, लेकिन मानव-केंद्रित कार्यों के लिए प्रशिक्षण के दौरान इसे फ़िल्टर या सावधानी से संभालना चाहिए। लेखकों ने WildAI, एक 83B-टोकन कॉर्पस लेबल्स के साथ, और कोड व मॉडल वेट्स जारी किए हैं।