Un estudio de Pangram Labs sobre texto web generado por IA "salvaje" revela que añadir estos tokens a los datos de preentrenamiento inicialmente reduce la pérdida en texto humano, pero rápidamente se invierte en perjuicio a medida que aumenta la proporción. Los investigadores preentrenaron 800 modelos de lenguaje para derivar una nueva ley de escalado que tenga en cuenta esta dinámica, que las leyes existentes como Chinchilla no logran predecir.

  • El análisis de los datos de FineWeb muestra que los tokens generados por IA aumentaron del 27.5% en junio de 2026 al 31.1% para agosto.
  • Para modelos con escasez de datos, los tokens de IA añadidos reducen inicialmente la pérdida del texto humano pero se saturan y luego la aumentan.
  • Los modelos entrenados con grandes presupuestos de texto humano ven aumentar su pérdida casi inmediatamente al añadir tokens de IA.
  • La nueva ley de escalado predice la pérdida de texto humano en datos no vistos para modelos hasta 3.6 veces más grandes, con un error 41% menor que las leyes existentes.

Los autores recomiendan filtrar el texto de IA cuando el objetivo es el texto humano, repetir el texto humano antes de expandir los conjuntos de datos con contenido generado por IA, e informar la pérdida de validación en texto humano y texto AI por separado.