Авторы представляют Growing Harness — парадигму обучения, которая изучает структуру управления агентом на основе обратной связи от задач, а не полагается на стандартные тяжеловесные контекстные обвязки. Преобразуя повторяющиеся решения по управлению в исполняемый код и оставляя вызовы LLM для семантического рассуждения, метод стремится создавать переиспользуемых специализированных агентов.
- Growing Harness использует каркас без стратегии с фиксированными интерфейсами, локализуя ошибки через трассировки выполнения на уровне функций.
- Оптимизатор совместно восстанавливает окна ошибок, а шлюз приоритета успеха откатывает изменения, вредящие предыдущей способности.
- На наборах BrowseComp-Plus и WebArena-Verified с моделями от 4B до 120B параметров метод достиг наивысшего среднего успеха в пяти из шести настроек.
- Он сокращает количество вызовов LLM на 76.0-91.8% и стоимость вывода развернутого агента на 74.4-98.6% по сравнению с агентом Tool-Calling.
- На WebArena-Verified успех остается стабильным на уровне 44.7-45.3% при различных масштабах моделей, тогда как Tool-Calling падает до 6.7% для модели 4B.
Постоянный рост программы выносит повторяющееся управление из контекста модели в низкозатратный код, позволяя агентам оставаться эффективными даже при развертывании с меньшими моделями.