Исследование Pangram Labs 800 предварительно обученных языковых моделей показывает, что «дикий» ИИ-сгенерированный веб-текст, который теперь составляет более 31% недавних веб-данных, негативно влияет на производительность модели, когда цель заключается в обработке человеческого текста. Исследование демонстрирует, что хотя небольшие количества ИИ-токенов могут изначально помочь моделям, испытывающим нехватку данных, они быстро превращаются во вред по мере увеличения их доли.

  • Для моделей, обученных на больших бюджетах человеческого текста, добавление ИИ-токенов почти сразу повышает функцию потерь, тогда как свежие человеческие токены продолжают её снижать.
  • Существующие законы масштабирования не способны предсказать это поведение; авторы предлагают новый закон с отдельными членами для пользы и вреда, который снижает ошибку прогнозирования на 41% по сравнению с существующими методами.
  • Исследование рекомендует фильтровать ИИ-текст для моделей, ориентированных на человека, повторять человеческий текст перед добавлением ИИ-данных, а также сообщать о функции потерь валидации для человеческого и ИИ-текста отдельно.

Выводы указывают на то, что ИИ-текст остаётся ценным только тогда, когда целевая задача связана с ИИ-текстом, но его следует фильтровать или обрабатывать осторожно при обучении для задач, ориентированных на человека. Авторы публикуют WildAI — корпус из 83B токенов с метками, а также код и веса модели.