Une étude de Pangram Labs sur le texte web généré par IA « sauvage » révèle que l'ajout de tels tokens aux données de pré-entraînement réduit initialement la perte sur le texte humain, mais s'inverse rapidement en nuisance à mesure que le ratio augmente. Les chercheurs ont pré-entraîné 800 modèles linguistiques pour déduire une nouvelle loi d'échelle qui tient compte de cette dynamique, que les lois existantes comme Chinchilla ne parviennent pas à prédire.
- L'analyse des données FineWeb montre que les tokens générés par IA sont passés de 27,5 % en juin 2026 à 31,1 % en août.
- Pour les modèles affamés en données, l'ajout de tokens IA réduit initialement la perte sur le texte humain, mais sature puis l'augmente.
- Les modèles entraînés avec de gros budgets en texte humain voient leur perte augmenter presque immédiatement dès l'ajout de tokens IA.
- La nouvelle loi d'échelle prédit la perte sur le texte humain hors ensemble pour des modèles jusqu'à 3,6 fois plus grands, avec une erreur de 41 % inférieure à celle des lois existantes.
Les auteurs recommandent de filtrer le texte IA lorsque l'objectif est le texte humain, de répéter le texte humain avant d'étendre les ensembles de données avec du contenu généré par IA, et de rapporter la perte de validation sur le texte humain et le texte IA séparément.