研究人员推出了 Mid-Harness,这是一种在模型-执行器边界采样和验证候选动作的方法,旨在提高终端智能体的执行可靠性。该方法通过在转发一个动作供执行之前验证多个选项来分配测试时计算资源,同时保持生成器和执行器不变。

  • 在 TerminalBench-Lite 上,使用带有 8 个采样动作的 GPT-5.6 Sol 验证器,与基础智能体相比,Pass@1 从 50.00% 提升至 68.03%。
  • 当 TMAX-9B 担任验证器时,成对验证在已评估的机制中取得了最佳结果。
  • 将更强验证器的响应蒸馏到 TMAX-9B 中,在不改变动作生成器的情况下进一步提升了 Pass@1。
  • 结合动作和轨迹扩展与 TMAX-9B,相比单独生成更多轨迹,能以更低的估计 token 成本实现更高的成功率。

这些发现确定了动作扩展作为终端智能体测试时计算扩展的一个有前景的目标,在额外的模型、基准和执行器上提升了性能。