Исследование Pangram Labs «дикого» ИИ-сгенерированного веб-текста показывает, что добавление таких токенов в данные для предобучения сначала снижает потерю на человеческом тексте, но быстро превращается во вред по мере увеличения соотношения. Исследователи провели предобучение 800 языковых моделей, чтобы вывести новый закон масштабирования, учитывающий эту динамику, который существующие законы, такие как Chinchilla, не способны предсказать.

  • Анализ данных FineWeb показывает, что доля ИИ-сгенерированных токенов выросла с 27.5% в июне 2026 года до 31.1% к августу.
  • Для моделей, испытывающих нехватку данных, добавление ИИ-токенов сначала снижает потерю на человеческом тексте, но затем насыщается и начинает её увеличивать.
  • Модели, обученные на больших бюджетах человеческого текста, видят рост своей потери почти сразу после добавления ИИ-токенов.
  • Новый закон масштабирования предсказывает потерю на отложенном человеческом тексте для моделей размером до 3.6x с ошибкой на 41% ниже, чем у существующих законов.

Авторы рекомендуют фильтровать ИИ-текст, когда цель — человеческий текст, повторять человеческий текст перед расширением наборов данных ИИ-сгенерированным контентом и отчитываться о потере валидации на человеческом и ИИ-тексте отдельно.