Авторы представляют Harness Continual Learning (HCL), парадигму, в которой агент улучшает свои способности, эволюционируя свой интерфейс-facing harness, а не обновляя параметры модели. Этот подход решает задачу сохранения ранее приобретенного поведения при адаптации к новому опыту через такие компоненты, как промпты, память и правила маршрутизации.
- HCL использует четыре компонента: Task Interface, Experience Memory, Capability Map и Adaptive Router.
- Guarded harness evolution разделяет генерацию обновлений и фиксацию состояния с помощью Continual Optimizer и Evaluator.
- Эксперименты показывают относительный прирост более 10% по сравнению с базовыми методами в текстовом рассуждении, мультимодальном восприятии и взаимодействии в открытом мире.
- Контролируемые сканирования удержания выявляют измеримое забывание на уровне harness и позволяют явно регулировать компромисс между стабильностью и пластичностью.
Этот метод позволяет накапливать способности и восстанавливаться после сбоев, не нарушая ранее приобретенное поведение, сохраняя базовую модель замороженной.