Os autores introduzem o Harness Continual Learning (HCL), um paradigma onde um agente melhora evoluindo seu harness voltado à execução em vez de atualizar os parâmetros do modelo. Esta abordagem aborda o desafio de reter o comportamento previamente adquirido enquanto se adapta a novas experiências por meio de componentes como prompts, memórias e regras de roteamento.
- O HCL utiliza quatro componentes: Task Interface, Experience Memory, Capability Map e Adaptive Router.
- A evolução do harness protegido separa a geração de atualizações do compromisso do estado usando um Continual Optimizer e Evaluator.
- Experimentos mostram ganhos relativos superiores a 10% em relação às linhas de base em raciocínio textual, percepção multimodal e interação em mundo aberto.
- Varreduras de retenção controladas revelam esquecimento mensurável ao nível do harness e permitem o ajuste explícito da compensação entre estabilidade e plasticidade.
Este método permite a acumulação de capacidades e recuperação de falhas sem interromper o comportamento adquirido anteriormente, mantendo o modelo base congelado.