研究者はnanoGPT、ResNet-18、および拡散U-Netに対して因果実験を行い、トレーニング、学習、推論のメカニクスを調査しました。結果は、これらのプロセスが更新によって非線形応答と持続的な機能的再編成を引き起こし、それが後続の状態に影響を与えるという連続したサイクルを形成していることを示しています。

  • 同じ更新を異なる受信状態に適用すると、異なる効果が得られる。
  • 学習は分散された機能的サポートに持続的な変化を残す。
  • 凍結推論はこのサポートを活用し、フィードバックが将来の学習のための状態を変更する。
  • この構造的関係は、異なるアーキテクチャ、タスク、モダリティ、オプティマイザにわたって成立する。

著者は、ニューラルネットワークを単純なパラメータ化された入出力関数ではなく、古典的な状態保持動的システムとして捉えることを提案しており、関連論文とGitHubリポジトリがこれを支持しています。