作者引入了 Harness Continual Learning (HCL),这是一种范式,其中智能体通过演化其面向执行的 harness 而非更新模型参数来改进。这种方法解决了在通过提示、记忆和路由规则等组件适应新经验的同时保留先前获得的行为的挑战。
- HCL 利用四个组件:Task Interface、Experience Memory、Capability Map 和 Adaptive Router。
- Guarded harness evolution 使用 Continual Optimizer 和 Evaluator 将更新生成与状态承诺分离。
- 实验显示,在文本推理、多模态感知和开放世界交互方面,相对于基线的相对增益超过 10%。
- 受控的保留扫描揭示了可测量的 harness 级别遗忘,并允许明确调整稳定性-可塑性权衡。
通过保持基础模型冻结,此方法能够在不破坏先前获得的行为的情况下实现能力积累和故障恢复。