作者提出了 Growing Harness,这是一种训练范式,它从任务反馈中学习代理的控制结构,而不是依赖标准的、上下文密集的 harness。通过将重复的控制决策转换为可执行代码,并将 LLM 调用保留用于语义推理,该方法旨在创建可复用的专家代理。

  • Growing Harness 使用无策略的脚手架和固定接口,通过函数级执行轨迹定位故障。
  • 优化器联合修复故障窗口,而成功优先的门控机制会回滚损害先前能力的编辑。
  • 在 BrowseComp-Plus 和 WebArena-Verified 上,针对参数量从 4B 到 120B 的模型,它在六项设置中的五项取得了最高的平均成功率。
  • 与 Tool-Calling 代理相比,它将 LLM 调用减少了 76.0-91.8%,并将已部署代理的推理成本降低了 74.4-98.6%。
  • 在 WebArena-Verified 上,随着模型规模的扩大,成功率稳定在 44.7-45.3%,而 Tool-Calling 在使用 4B 模型时降至 6.7%。

持续的程序增长将重复的控制从模型上下文中移出并转化为低成本代码,使得代理即使在部署较小模型时也能保持高效。