Авторы представляют Harness Continual Learning (HCL), парадигму, в которой агент улучшает свои способности, эволюционируя свой интерфейс-facing harness, а не обновляя параметры модели. Этот подход решает задачу сохранения ранее приобретенного поведения при адаптации к новому опыту через такие компоненты, как промпты, память и правила маршрутизации.

  • HCL использует четыре компонента: Task Interface, Experience Memory, Capability Map и Adaptive Router.
  • Guarded harness evolution разделяет генерацию обновлений и фиксацию состояния с помощью Continual Optimizer и Evaluator.
  • Эксперименты показывают относительный прирост более 10% по сравнению с базовыми методами в текстовом рассуждении, мультимодальном восприятии и взаимодействии в открытом мире.
  • Контролируемые сканирования удержания выявляют измеримое забывание на уровне harness и позволяют явно регулировать компромисс между стабильностью и пластичностью.

Этот метод позволяет накапливать способности и восстанавливаться после сбоев, не нарушая ранее приобретенное поведение, сохраняя базовую модель замороженной.