Um estudo da Pangram Labs sobre texto web gerado por IA "selvagem" revela que adicionar tais tokens aos dados de pré-treinamento inicialmente reduz a perda em textos humanos, mas rapidamente se inverte em prejuízo à medida que a proporção aumenta. Os pesquisadores pré-treinaram 800 modelos de linguagem para derivar uma nova lei de escalonamento que leva em conta essa dinâmica, a qual leis existentes como Chinchilla não conseguem prever.
- Análise dos dados do FineWeb mostra que os tokens gerados por IA subiram de 27,5% em junho de 2026 para 31,1% em agosto.
- Para modelos com escassez de dados, a adição de tokens de IA reduz inicialmente a perda em textos humanos, mas satura e depois a aumenta.
- Modelos treinados com grandes orçamentos de texto humano veem sua perda aumentar quase imediatamente ao adicionar tokens de IA.
- A nova lei de escalonamento prevê a perda de texto humano em dados não vistos para modelos até 3,6x maiores com 41% menos erro do que as leis existentes.
Os autores recomendam filtrar o texto de IA quando o alvo é texto humano, repetir o texto humano antes de expandir conjuntos de dados com conteúdo gerado por IA e relatar a perda de validação em textos humanos e de IA separadamente.