研究人员推出了 OpenForgeRL,这是一个开源框架,允许使用 Claude Code 和 OpenClaw 等复杂推理工具链对 AI 代理进行端到端训练。该系统通过采用轻量级代理将模型调用记录为数据,并使用 Kubernetes 编排器管理远程容器部署,从而将训练与推理解耦。

  • OpenForgeRL 支持多样化的环境,包括基于工具的代理和多模态 GUI 浏览器代理。
  • OpenForgeClaw 仅使用数百到数千个任务,在 ClawEval 上达到 31.7 pass^3,在 QwenClawBench 上达到 33.7。
  • OpenForgeGUI 在 OSWorld-Verified 上达到 37.7,在 Online-Mind2Web 上达到 63.0,在 WebVoyager 上达到 72.3。
  • 这两种变体均优于同规模的开源基线,并在 GUI 设置中匹配或超越更大的模型。
  • 分析表明,工具链的选择显著影响学习难度,且强化学习(RL)提升了自我验证等可靠性指标。

该框架使研究人员能够在代理实际部署的真实工具链和环境中直接训练、研究和改进代理。