著者らはGrowing Harnessを紹介する。これは標準的な文脈依存のハッスルに頼るのではなく、タスクフィードバックからエージェントの制御構造を学習するトレーニングパラダイムである。反復的な制御判断を実行可能なコードに変換し、意味的推論のためにLLM呼び出しを予約することで、再利用可能な専門エージェントの作成を目指す。
- Growing Harnessは固定インターフェースを持つ戦略非依存のスケフォールドを使用し、関数レベルの実行トレースを通じて失敗を局所化する。
- オプティマイザは失敗のウィンドウを共同で修復し、成功優先ゲートは以前の能力を損なう編集をロールバックする。
- 4Bから120Bパラメータのモデルを用いたBrowseComp-PlusおよびWebArena-Verifiedにおいて、6つの設定のうち5つで最高の平均成功率を達成した。
- Tool-Callingエージェントと比較して、LLM呼び出し数を76.0-91.8%削減し、デプロイ済みエージェントの推論コストを74.4-98.6%削減した。
- WebArena-Verifiedでは、モデルスケール全体で成功率が44.7-45.3%で安定しているのに対し、Tool-Callingは4Bモデルで6.7%に低下する。
持続的なプログラム成長により、反復的な制御がモデルの文脈から低コストなコードへ移動し、より小さなモデルでデプロイされてもエージェントが効果的に機能し続けることを可能にする。