一篇新预印本分析了八个本地化部署的小型开源Transformer模型的隐藏状态动态,以确定内部表征在推理过程中是否遵循结构化演进。该研究区分了跨模型深度的变化与随自回归生成时间演化的变化。

  • 跨模型深度的局部排序比随机排列更具结构性(p = 0.00019996),且在所有留一法检查中均成立。
  • 跨模型深度剖面显示出高度一致性,平均相关系数约为 r = 0.789。
  • 功能标记事件与归一化层深度存在统计关联(p = 0.0024)。
  • 先前观察到的共同时间模式在扩展面板中未能复现,在8次留一法检查中全部失败(0/8)。
  • 具有相似功能输出或来自同一架构家族的模型未显示出显著的结构相似性。

结果表明,Transformer推理沿深度方向包含可复现的结构,同时在时间和行为上高度条件依赖,这挑战了存在通用时间动态的观点。