تكشف دراسة أجرتها بانغرام لابز على 800 نموذج لغوي مُدرَّب مسبقاً أن النصوص الويب المولّدة بالذكاء الاصطناعي "البرية"، والتي تشكل الآن أكثر من 31% من بيانات الويب الحديثة، تؤثر سلباً على أداء النموذج عندما يكون الهدف هو معالجة النص البشري. تُظهر الأبحاث أنه بينما قد تساعد الكميات الصغيرة من رموز الذكاء الاصطناعي النماذج التي تعاني من شح البيانات في البداية، فإنها تتحول بسرعة إلى ضرر مع زيادة نسبتها.
- بالنسبة للنماذج المُدرَّبة على كميات كبيرة من الميزانية الخاصة بالنص البشري، يؤدي إضافة رموز الذكاء الاصطناعي إلى رفع دالة الخسارة فوراً، بينما تستمر الرموز البشرية الجديدة في خفضها.
- تفشل قوانين القياس الحالية في التنبؤ بهذا السلوك؛ ويقترح المؤلفون قانوناً جديداً يحتوي على حدود منفعة وضرر، مما يقلل خطأ التنبؤ بنسبة 41% مقارنة بالأساليب الموجودة.
- توصي الدراسة بفلترة النصوص المولّدة بالذكاء الاصطناعي للنماذج المستهدفة للبشر، وتكرار النص البشري قبل إضافة بيانات الذكاء الاصطناعي، والإبلاغ عن خسارة التحقق من الصحة على النصوص البشرية والذكاء الاصطناعي بشكل منفصل.
تشير النتائج إلى أن نصوص الذكاء الاصطناعي تظل ذات قيمة فقط عندما يكون الهدف هو نصوص الذكاء الاصطناعي، ولكن يجب فلترتها أو التعامل معها بعناية عند التدريب للمهام المتمحورة حول الإنسان. يُصدر المؤلفون مجموعة بيانات WildAI المكونة من 83B رمزاً مع التسميات، بالإضافة إلى الكود وأوزان النموذج.