Un chercheur a mené des expériences causales sur nanoGPT, ResNet-18 et un U-Net de diffusion pour étudier la mécanique de l'entraînement, de l'apprentissage et de l'inférence. Les résultats indiquent que ces processus forment un cycle continu où les mises à jour provoquent des réponses non linéaires et une réorganisation fonctionnelle persistante, qui influencent ensuite les états suivants.

  • Appliquer la même mise à jour à différents états récepteurs produit des effets différents.
  • L'apprentissage laisse des changements persistants dans le support fonctionnel distribué.
  • L'inférence figée recrute ce support, et la rétroaction modifie l'état pour l'apprentissage futur.
  • Cette relation structurelle s'applique à différentes architectures, tâches, modalités et optimiseurs.

L'auteur propose de considérer les réseaux neuronaux comme des systèmes dynamiques classiques avec état plutôt que comme de simples fonctions paramétrées d'entrée-sortie, soutenu par un article lié et un dépôt GitHub.