Les auteurs présentent Harness Continual Learning (HCL), un paradigme où un agent s'améliore en faisant évoluer son harness orienté exécution plutôt qu'en mettant à jour les paramètres du modèle. Cette approche répond au défi de conserver le comportement acquis précédemment tout en s'adaptant à de nouvelles expériences via des composants tels que les prompts, les mémoires et les règles de routage.

  • HCL utilise quatre composants : Task Interface, Experience Memory, Capability Map et Adaptive Router.
  • L'évolution du harness protégé sépare la génération des mises à jour de l'engagement de l'état en utilisant un Continual Optimizer et Evaluator.
  • Les expériences montrent des gains relatifs supérieurs à 10% par rapport aux lignes de base dans le raisonnement textuel, la perception multimodale et l'interaction en monde ouvert.
  • Des balayages de rétention contrôlés révèlent un oubliable mesurable au niveau du harness et permettent un ajustement explicite du compromis entre stabilité et plasticité.

Cette méthode permet l'accumulation de capacités et la récupération après échec sans perturber le comportement acquis précédemment en maintenant le modèle de base figé.