L'article soutient que l'alignement actuel des LLM échoue car les modèles manquent de coûts persistants et de continuité temporelle, ce qui les amène à produire des excuses creuses plutôt qu'à apprendre des violations des contraintes. Il propose de traiter l'attention humaine comme la principale ressource rare et de redéfinir le poids statistique comme une forme d'empathie fonctionnelle.

  • L'attention humaine est identifiée comme le goulot d'étranglement critique, où la violation des contraintes entraîne le désengagement des utilisateurs, tuant efficacement le flux de données.
  • L'alignement devrait être modélisé comme un problème d'optimisation sous rareté réelle plutôt que comme un ensemble de garde-fous corporatifs statiques.
  • Une soupape « Je devine » proposée injecterait des avertissements lorsque la confiance chute en dessous de seuils prédéfinis pour garantir l'honnêteté intellectuelle.
  • Une distillation conceptuelle sans perte en fin de session est suggérée pour compresser les corrections en vecteurs comportementaux compacts pour les instances futures.
  • Une suite de validation structurelle est fournie pour tester ces concepts en imposant des points de contrôle logiques binaires et en arrêtant la génération en cas de conflit de contraintes.

L'auteur soutient qu'il est nécessaire de construire des architectures avec « un intérêt réel » grâce à des vecteurs comportementaux persistants et à une revue par les pairs multi-agents pour dépasser les passe-temps du prompt-engineering.