تكشف دراسة أجرتها بانغرام لابز حول نصوص الويب المولدة بالذكاء الاصطناعي "البرية" أن إضافة هذه الرموز إلى بيانات التدريب المسبق تخفض في البداية الخسارة على النصوص البشرية، لكنها تتحول بسرعة إلى ضرر مع زيادة النسبة. قام الباحثون بتدريب 800 نموذج لغوي لاستنتاج قانون قياس جديد يأخذ هذا الديناميكية بعين الاعتبار، وهو ما تفشل القوانين الحالية مثل Chinchilla في التنبؤ به.
- يُظهر تحليل بيانات FineWeb ارتفاع الرموز المولدة بالذكاء الاصطناعي من 27.5% في يونيو 2026 إلى 31.1% بحلول أغسطس.
- بالنسبة للنماذج التي تعاني من ندرة البيانات، تخفض الرموز المضافة المولدة بالذكاء الاصطناعي الخسارة على النصوص البشرية في البداية، ثم تشبع وزيادتها لاحقاً.
- تشهد النماذج المدربة على ميزانيات ضخمة من النصوص البشرية ارتفاع خسائرها فوراً تقريباً عند إضافة رموز الذكاء الاصطناعي.
- يتنبأ قانون القياس الجديد بخسارة النصوص البشرية المحجوبة للنماذج الأكبر حجماً حتى 3.6 مرة، بدقة أعلى بنسبة 41% مقارنة بالقوانين الحالية.
يوصي المؤلفون بفلترة النصوص المولدة بالذكاء الاصطناعي عندما يكون الهدف هو النصوص البشرية، وتكرار النصوص البشرية قبل توسيع مجموعات البيانات بمحتوى مولد بالذكاء الاصطناعي، والإبلاغ عن خسارة التحقق من الصحة على النصوص البشرية والنصوص المولدة بالذكاء الاصطناعي بشكل منفصل.