Dyna Roboticsは、100万時間以上の自己中心型人間の動画で事前学習されたロボット操作用の世界行動モデル「Dyna-2」をリリースした。同社は、1,000時間から1,000,000時間へのスケーリング法則を確立することで、通常の人間の動画がアクションラベル付きデータの代用になり得ることを実証している。

  • Dyna-2は、未来の動画とアクションチャンクを共同でノイズ除去するビデオ拡散バックボーンを使用する生成モデルである。
  • このモデルは、人間のデータに対してスケーリング法則を示し、2つの固定式両腕プラットフォーム間で未見のロボットタスクにゼロショット転移可能である。
  • 動画とアクションの共同ノイズ除去はアクション単独の学習を上回り、特に動画が異なる身体表現間の汎化を助けている。
  • 14のタスクでのポストトレーニングにより、データが100万時間までスケールするにつれて平均正規化スコアが20%から53%に上昇した。
  • Dyna-2は、以前のDyna-1モデルが46%だったのに対し、未見の顧客サイトの87%で生産基準をクリアした。

この研究は、動画予測がロボットデータへの転移を促進し、高価なテレオペレーションに依存するのではなく、膨大な量のラベルなし人間の経験から学習できることを示している。