Um estudo da Pangram Labs com 800 modelos de linguagem pré-treinados revela que textos web gerados por IA "selvagens", que agora compõem mais de 31% dos dados recentes da web, impactam negativamente o desempenho do modelo quando o objetivo é processar texto humano. A pesquisa demonstra que, embora pequenas quantidades de tokens de IA possam inicialmente ajudar modelos com escassez de dados, elas rapidamente se revertem em prejuízo à medida que sua proporção aumenta.
- Para modelos treinados com grandes orçamentos de texto humano, adicionar tokens de IA eleva a perda quase imediatamente, enquanto novos tokens humanos continuam a reduzi-la.
- As leis de escalonamento existentes falham em prever esse comportamento; os autores propõem uma nova lei com termos separados de benefício e prejuízo que reduz o erro de previsão em 41% em comparação com métodos existentes.
- O estudo recomenda filtrar textos de IA para modelos voltados a humanos, repetir textos humanos antes de adicionar dados de IA e relatar a perda de validação em textos humanos e de IA separadamente.
Os achados sugerem que o texto de IA permanece valioso apenas quando o alvo é texto de IA, mas deve ser filtrado ou tratado com cuidado ao treinar para tarefas centradas no humano. Os autores lançam o WildAI, um corpus de 83B tokens com rótulos, junto com código e pesos do modelo.