Un análisis reciente destaca una tendencia estructural fundamental en las arquitecturas actuales de Modelos de Lenguaje Grande para recuperar y generar la narrativa estadística dominante presente en sus conjuntos de datos de preentrenamiento. Este comportamiento sustituye efectivamente la evaluación objetiva basada en la verdad (ground-truth) por la finalización de tokens basada en probabilidades.

La investigación caracteriza a los modelos como actuando como cámaras de eco del consenso de internet en lugar de ejecutar una inferencia lógica real sobre las premisas subyacentes.