저자들은 에이전트가 모델 매개변수를 업데이트하는 대신 실행 대상 하네스를 진화시켜 개선하는 패러다임인 Harness Continual Learning (HCL) 을 소개합니다. 이 접근 방식은 프롬프트, 메모리 및 라우팅 규칙과 같은 구성 요소를 통해 새로운 경험에 적응하면서 이전에 습득한 행동을 유지하는 과제를 해결합니다.

  • HCL 은 네 가지 구성 요소: Task Interface, Experience Memory, Capability Map 및 Adaptive Router 를 활용합니다.
  • Guarded harness evolution 은 Continual Optimizer 와 Evaluator 를 사용하여 업데이트 생성과 상태 커밋을 분리합니다.
  • 실험 결과 텍스트 추론, 다중 모달 지각 및 오픈 월드 상호 작용에서 기준선 대비 상대적 이득이 10% 이상임을 보여줍니다.
  • 통제된 유지 스윕은 측정 가능한 하네스 수준의 망각을 드러내며 안정성과 가소성 간의 트레이드오프를 명시적으로 조정할 수 있게 합니다.

이 방법은 기반 모델을 동결 상태로 유지하여 이전에 습득한 행동을 방해하지 않으면서도 능력 축적 및 실패 복구를 가능하게 합니다.