Los autores presentan Harness Continual Learning (HCL), un paradigma donde un agente mejora evolucionando su harness orientado a la ejecución en lugar de actualizar los parámetros del modelo. Este enfoque aborda el desafío de retener el comportamiento previamente adquirido mientras se adapta a nuevas experiencias a través de componentes como prompts, memorias y reglas de enrutamiento.

  • HCL utiliza cuatro componentes: Task Interface, Experience Memory, Capability Map y Adaptive Router.
  • La evolución del harness protegido separa la generación de actualizaciones del compromiso del estado utilizando un Continual Optimizer y Evaluator.
  • Los experimentos muestran ganancias relativas superiores al 10% sobre las líneas base en razonamiento textual, percepción multimodal e interacción en el mundo abierto.
  • Barridos de retención controlados revelan olvido medible a nivel de harness y permiten ajustar explícitamente la compensación entre estabilidad y plasticidad.

Este método permite la acumulación de capacidades y la recuperación de fallos sin interrumpir el comportamiento adquirido anteriormente al mantener congelado el modelo base.