最近的一项分析突显了当前大型语言模型架构中一个根本性的结构倾向:检索并输出其预训练数据集中占主导地位的统计叙事。这种行为有效地用基于概率的标记补全替代了客观的真值(ground-truth)评估。

该研究将模型描述为像互联网共识的回音室,而不是对底层前提执行实际的逻辑推理。