OpenForgeRL 是一个开源框架,允许研究人员使用标准的强化学习堆栈对基于工具链的 AI 智能体进行端到端训练。它通过一个轻量级代理将训练与推理解耦,该代理将模型调用记录为数据,并由 Kubernetes 编排器管理远程容器部署。

  • 该系统支持多种环境,包括基于工具/爪子的智能体和多模态 GUI 浏览器智能体。
  • OpenForgeClaw 在 ClawEval 上取得了 31.7 pass^3 的成绩,在 QwenClawBench 上取得了 33.7 的成绩,仅使用了数百到数千个任务。
  • OpenForgeGUI 在 OSWorld-Verified 上达到 37.7,在 Online-Mind2Web 上达到 63.0,在 WebVoyager 上达到 72.3。
  • 这两种变体均优于同规模的开源基线,并在 GUI 设置中匹配或超越更大的模型。
  • 分析表明,工具链的选择显著影响学习难度,且强化学习提高了如自我验证等可靠性指标。

该框架使智能体能够在其部署的真实工具链和环境中进行直接训练,从而促进对智能体行为的研究和改进。