"अराजक" AI-जनित वेब टेक्स्ट पर Pangram Labs के एक अध्ययन से पता चलता है कि ऐसे टोकन को प्रीट्रेनिंग डेटा में जोड़ने से मनुष्य द्वारा लिखे गए टेक्स्ट पर हानि (loss) शुरू में कम होती है, लेकिन अनुपात बढ़ने के साथ यह जल्दी ही हानि में बदल जाती है। शोधकर्ताओं ने इस गतिशीलता को समझने के लिए 800 भाषा मॉडलों का प्रीट्रेनिंग किया और एक नया स्केलिंग नियम व्युत्पन्न किया, जो Chinchilla जैसे मौजूदा नियमों द्वारा अनुमानित नहीं किया जा सकता है।
- FineWeb डेटा के विश्लेषण से पता चलता है कि AI-जनित टोकन की मात्रा जून 2026 में 27.5% से बढ़कर अगस्त तक 31.1% हो गई।
- डेटा-अभाव वाले मॉडलों के लिए, जोड़े गए AI टोकन शुरू में मनुष्य द्वारा लिखे गए टेक्स्ट की हानि को कम करते हैं, लेकिन फिर संतृप्त हो जाते हैं और अंत में उसे बढ़ा देते हैं।
- उच्च बजट वाले मनुष्य द्वारा लिखे गए टेक्स्ट पर प्रशिक्षित मॉडलों में AI टोकन जोड़ने पर उनकी हानि लगभग तुरंत बढ़ जाती है।
- नया स्केलिंग नियम मौजूदा नियमों की तुलना में 41% कम त्रुटि के साथ 3.6x बड़े मॉडलों के लिए हटाए गए मनुष्य द्वारा लिखे गए टेक्स्ट की हानि का अनुमान लगाता है।
लेखकों ने सुझाव दिया है कि यदि लक्ष्य मनुष्य द्वारा लिखे गए टेक्स्ट है तो AI टेक्स्ट को फिल्टर करें, डेटासेट में AI-जनित सामग्री जोड़ने से पहले मनुष्य द्वारा लिखे गए टेक्स्ट को दोहराएं, और मान्यता हानि (validation loss) को मनुष्य और AI टेक्स्ट के लिए अलग-अलग रिपोर्ट करें।