OpenForgeRL 是一个开源框架,允许研究人员使用标准的强化学习堆栈对基于工具链的 AI 智能体进行端到端训练。它通过采用轻量级代理将模型调用记录为数据,并使用 Kubernetes 编排器在远程容器中管理 rollout,从而将训练与推理解耦。
- 该系统支持多种环境,包括基于工具/爪的智能体和多模态 GUI 浏览器智能体。
- OpenForgeClaw 仅使用数百到数千个任务,便在 ClawEval 上取得了 31.7 pass^3 的成绩,在 QwenClawBench 上取得了 33.7 的成绩。
- OpenForgeGUI 在 OSWorld-Verified 上达到 37.7,在 Online-Mind2Web 上达到 63.0,在 WebVoyager 上达到 72.3。
- 这两种变体均优于同规模的开源基线,并在 GUI 设置中匹配或超越更大的模型。
- 分析表明,工具链的选择显著影响学习难度,且强化学习提高了自我验证等可靠性指标。
该框架使得直接在部署环境中研究和改进智能体成为可能,证明了尽管在错误恢复方面仍存在弱点,但强化学习能够增强智能体的可靠性。