研究人员推出了SkillGym,这是一个框架,可将人工编写的智能体技能转化为可执行、可验证的大语言模型智能体训练环境。该系统利用技能到任务(skill-to-task)流水线实例化具体任务,并通过基于代码的检查器验证结果。

  • 团队构建并发布了12个类别中的2,756个环境。
  • 他们收集了8,364条成功轨迹,平均包含49次工具调用和超过60k个记录的文本token。
  • 在已验证的工作流程上进行监督微调,使Qwen3.5-35B-A3B在GDPval-AA v2上的Elo评分提升了199分。
  • 最终生成的35B SkillGym-Agent在skill-assisted SkillsBench上达到51.47%的得分,超过了Claude Sonnet 4.6和GPT-5.4 Mini的得分。

该方法实现了可重用程序性能力的内化,使模型能够比使用外部推理时指令更有效地解决现实世界问题。