Os autores apresentam o Growing Harness, um paradigma de treinamento que aprende a estrutura de controle de um agente a partir do feedback da tarefa, em vez de depender de harnesses padrão com grande carga contextual. Ao converter decisões de controle recorrentes em código executável e reservar chamadas de LLM para raciocínio semântico, o método visa criar agentes especialistas reutilizáveis.

  • O Growing Harness utiliza um andaime sem estratégia com interfaces fixas, localizando falhas por meio de rastros de execução em nível de função.
  • Um otimizador repara janelas de falhas conjuntamente, enquanto uma porta de sucesso primeiro desfaz edições que prejudicam a capacidade anterior.
  • No BrowseComp-Plus e WebArena-Verified com modelos de 4B a 120B parâmetros, alcançou a maior média de sucesso em cinco dos seis cenários.

Reduz as chamadas de LLM em 76,0-91,8% e o custo de inferência do agente implantado em 74,4-98,6% em relação a um agente Tool-Calling.

  • No WebArena-Verified, o sucesso permanece estável em 44,7-45,3% em todas as escalas de modelos, enquanto o Tool-Calling cai para 6,7% com o modelo de 4B.

O crescimento persistente do programa transfere o controle recorrente do contexto do modelo para código de baixo custo, permitindo que os agentes permaneçam eficazes mesmo quando implantados com modelos menores.