Los autores presentan Growing Harness, un paradigma de entrenamiento que aprende la estructura de control de un agente a partir de la retroalimentación de la tarea, en lugar de depender de arneses estándar con gran carga contextual. Al convertir las decisiones de control recurrentes en código ejecutable y reservar las llamadas al LLM para el razonamiento semántico, el método busca crear agentes especialistas reutilizables.
- Growing Harness utiliza un andamio sin estrategia con interfaces fijas, localizando fallos mediante trazas de ejecución a nivel de función.
- Un optimizador repara ventanas de fallos de manera conjunta, mientras que una puerta de éxito primero revierte las ediciones que perjudican la capacidad previa.
- En BrowseComp-Plus y WebArena-Verified con modelos de 4B a 120B parámetros, logró la mayor tasa media de éxito en cinco de los seis entornos.
- Reduce las llamadas al LLM entre un 76.0% y un 91.8%, y el costo de inferencia del agente desplegado entre un 74.4% y un 98.6% en comparación con un agente Tool-Calling.
- En WebArena-Verified, el éxito se mantiene estable entre el 44.7% y el 45.3% a través de las escalas de modelos, mientras que Tool-Calling cae al 6.7% con el modelo de 4B.
El crecimiento persistente del programa traslada el control recurrente fuera del contexto del modelo hacia código de bajo costo, permitiendo que los agentes sigan siendo efectivos incluso cuando se despliegan con modelos más pequeños.