Os autores introduzem o Harness Continual Learning (HCL), um paradigma onde um agente melhora evoluindo seu harness voltado à execução em vez de atualizar os parâmetros do modelo. Esta abordagem aborda o desafio de reter o comportamento previamente adquirido enquanto se adapta a novas experiências por meio de componentes como prompts, memórias e regras de roteamento.

  • O HCL utiliza quatro componentes: Task Interface, Experience Memory, Capability Map e Adaptive Router.
  • A evolução do harness protegido separa a geração de atualizações do compromisso do estado usando um Continual Optimizer e Evaluator.
  • Experimentos mostram ganhos relativos superiores a 10% em relação às linhas de base em raciocínio textual, percepção multimodal e interação em mundo aberto.
  • Varreduras de retenção controladas revelam esquecimento mensurável ao nível do harness e permitem o ajuste explícito da compensação entre estabilidade e plasticidade.

Este método permite a acumulação de capacidades e recuperação de falhas sem interromper o comportamento adquirido anteriormente, mantendo o modelo base congelado.