Une étude de Pangram Labs portant sur 800 modèles de langage pré-entraînés révèle que le texte web généré par l'IA « sauvage », qui représente désormais plus de 31 % des données web récentes, affecte négativement les performances des modèles lorsque l'objectif est de traiter du texte humain. La recherche démontre que si de petites quantités de tokens IA peuvent initialement aider les modèles affamés de données, elles se transforment rapidement en nuisance à mesure que leur proportion augmente.
- Pour les modèles entraînés sur d'importants budgets de texte humain, l'ajout de tokens IA augmente la perte presque immédiatement, tandis que les nouveaux tokens humains continuent de la réduire.
- Les lois d'échelle existantes ne parviennent pas à prédire ce comportement ; les auteurs proposent une nouvelle loi avec des termes distincts pour le bénéfice et la nuisance, réduisant l'erreur de prédiction de 41 % par rapport aux méthodes existantes.
- L'étude recommande de filtrer le texte IA pour les modèles ciblant les humains, de répéter le texte humain avant d'ajouter des données IA, et de rapporter la perte de validation sur le texte humain et le texte IA séparément.
Les résultats suggèrent que le texte IA ne reste utile que lorsque la cible est du texte IA, mais doit être filtré ou manipulé avec soin lors de l'entraînement pour des tâches centrées sur l'humain. Les auteurs publient WildAI, un corpus de 83 milliards de tokens avec étiquettes, ainsi que le code et les poids du modèle.