저자들은 Growing Harness를 소개합니다. 이는 표준적인 컨텍스트 중심의 하네스에 의존하는 대신 작업 피드백으로부터 에이전트의 제어 구조를 학습하는 훈련 패러다임입니다. 반복되는 제어 결정을 실행 가능한 코드로 변환하고 LLM 호출은 의미론적 추론에 할당함으로써, 이 방법은 재사용 가능한 전문 에이전트를 만드는 것을 목표로 합니다.
- Growing Harness는 고정된 인터페이스를 가진 전략 없는 스캐폴드를 사용하며, 함수 수준 실행 추적을 통해 실패를 국소화합니다.
- 옵티마이저는 실패 윈도우를 함께 수리하고, 성공 우선 게이트는 이전 능력을 해치는 편집을 롤백합니다.
4B에서 120B 파라미터에 이르는 모델로 BrowseComp-Plus와 WebArena-Verified에서 평가했을 때, 여섯 가지 설정 중 다섯 가지에서 최고 평균 성공률을 달성했습니다.
- Tool-Calling 에이전트 대비 LLM 호출을 76.0-91.8% 줄이고, 배포된 에이전트의 추론 비용을 74.4-98.6% 절감합니다.
WebArena-Verified에서 성공률은 모델 규모에 걸쳐 44.7-45.3%로 안정적으로 유지되는 반면, Tool-Calling은 4B 모델에서 6.7%로 떨어집니다.
지속적인 프로그램 성장은 반복되는 제어를 모델 컨텍스트에서 저비용 코드로 이동시켜, 에이전트가 더 작은 모델로 배포되어도 효과성을 유지할 수 있게 합니다.