Dyna Robotics 发布了 Dyna-2,这是一个用于机器人操作的世界动作模型,在一百多万小时的自我中心人类视频上进行了预训练。该公司通过建立从 1,000 到 1,000,000 小时的扩展定律,证明了普通人类视频可以替代带动作标签的数据。
- Dyna-2 是一个使用视频扩散主干的生成模型,对未来的视频和动作块进行联合去噪。
- 该模型在人类数据上表现出扩展定律,能够在两个固定双臂平台上实现零样本到未见机器人任务的迁移。
- 视频和动作的联合去噪优于仅训练动作,其中视频特别有助于跨具身泛化。
- 在 14 个任务上的后训练显示,随着数据扩展到一百万小时,平均归一化分数从 20% 上升到 53%。
- 与之前的 Dyna-1 模型在 46% 的未见客户站点相比,Dyna-2 在 87% 的未见客户站点通过了生产标准。
研究表明,视频预测驱动了向机器人数据的迁移,使系统能够从大量无标签的人类经验中学习,而不是依赖昂贵的遥操作。