VHD-Play 是一个流水线,通过对数学模型进行采样和求解,并将其决策过程呈现为有状态工具,从而生成多样化的代理式强化学习环境。该方法确保可执行动态和轨迹评分参考直接继承自已解模型,解决了现有生成流水线中常见的对齐问题。
- 该流水线以每个几分钱的成本生成了 3,300 个多样化的代理式环境。
- 在三个家族上训练 Qwen3.6-35B-A3B,使其在五家族诊断中的平均代理得分从 0.204 提升至 0.815。
- 收益延伸至保留实例、八个未见机制家族以及用于通用函数调用、旅行规划和电子商务的外部基准测试。
- 书面问题与有状态版本之间的比较表明,可学习的差距主要在于有状态交互,而非底层问题解决。
作者认为这具有重要意义,因为冻结的 35B 设置器可以生成更大的环境,且规模匹配的训练在机制规模和视界增长时仍能保持收益,这表明存在演化训练基底的潜力。