Un estudio de Pangram Labs sobre 800 modelos de lenguaje preentrenados revela que el texto web generado por IA "salvaje", que ahora compone más del 31% de los datos web recientes, afecta negativamente el rendimiento del modelo cuando el objetivo es procesar texto humano. La investigación demuestra que, aunque pequeñas cantidades de tokens de IA pueden ayudar inicialmente a los modelos con escasez de datos, rápidamente se revierten en perjuicio a medida que aumenta su proporción.
- Para los modelos entrenados con grandes presupuestos de texto humano, agregar tokens de IA eleva la pérdida casi de inmediato, mientras que los tokens humanos frescos continúan reduciéndola.
- Las leyes de escalado existentes fallan al predecir este comportamiento; los autores proponen una nueva ley con términos separados de beneficio y perjuicio que reduce el error de predicción en un 41% en comparación con los métodos existentes.
- El estudio recomienda filtrar el texto de IA para los modelos dirigidos a humanos, repetir el texto humano antes de agregar datos de IA e informar la pérdida de validación en el texto humano y de IA por separado.
Los hallazgos sugieren que el texto de IA sigue siendo valioso solo cuando el objetivo es el texto de IA, pero debe filtrarse o manejarse con cuidado al entrenar para tareas centradas en humanos. Los autores publican WildAI, un corpus de 83B tokens con etiquetas, junto con el código y los pesos del modelo.