一名研究人员对 nanoGPT、ResNet-18 和扩散 U-Net 进行了因果实验,以研究训练、学习和推理的机制。结果表明,这些过程形成了一个连续循环,其中更新导致非线性响应和持续的功能重组,进而影响后续状态。
- 将相同的更新应用于不同的接收状态会产生不同的效果。
- 学习在分布式功能支持中留下持久性变化。
- 冻结推理招募此支持,反馈改变未来学习的状态。
- 这种结构关系在不同架构、任务、模态和优化器中均成立。
作者提出将神经网络视为经典的状态动力学系统,而非简单的参数化输入输出函数,并附有相关论文和 GitHub 仓库。