来自 Google Cloud AI Research、华盛顿大学圣路易斯分校以及北卡罗来纳大学教堂山分校的一个团队发布了 EnvHarness,这是一个可编程层,可将静态智能体基准测试转化为自适应训练世界。该系统通过仅通过标准 reset() 和 step() 接口操作的插件组件包装现有环境,使环境能够在不改变底层模拟器或人工构建验证器的情况下适应策略的训练过程。

  • EnvHarness 使用名为 EnvRigger 的 LLM 设计器来诊断智能体轨迹中的缺陷,并自动编写针对性的包装器。
  • 该系统包含三个可组合的组件:Stage(重写初始状态)、Contract(在动作和观测上安装逐步骤钩子)以及 Chain(在共享预算下组合第二层环境)。
  • 在包括 ALFWorld、WebArena、SWE-bench Verified、OfficeQA 和 SpreadsheetBench 在内的五个基准测试中,通过 EnvHarness 挖掘的技能在未见过任务上最高提升了 9.0 分。
  • 在 SWE-bench Verified 上,该方法将平均执行步骤减少了 9.8%,同时将解决率从 49.88 提升至 52.58。
  • 代码以 Apache-2.0 Python 形式提供,仅需一个可重置的环境和现有的智能体评估循环。

作者认为这一点很重要,因为静态环境在问题解决后即停止教学,而 EnvHarness 允许智能体通过针对训练中识别出的特定弱点来继续学习。