上海AI研究所は、動的環境で実行可能な予測を維持するように設計されたInternW物理世界モデルシリーズの最初のインスタンスであるInternW0を発表した。このモデルは、フローマッチングを用いた非対称なビデオ・アクションアーキテクチャにより、未来の視覚的ダイナミクスと連続的なロボットの制御を共同で学習する。

  • InternW0は、長期のコンテキスト用の高容量ビデオエキスパートと、より高速な時間スケール用の軽量アクションエキスパートを採用している。
  • 層ごとのK/V状態を再利用し、コンテキストルーティングを通じて新しい観測値に適応させることで、更新ごとに再生成を回避する。
  • 訓練には、275時間のEgoLabデータセットを含む、約7,200時間にわたる多様なロボットおよび主観視点のデータが使用された。
  • 評価には、15段階の金属有機骨格(MOF)合成ワークフローと、5段階の接触認識可能な器用な操作が含まれる。

これらの結果は、普遍的かつ効率的な実世界相互作用のためのスケーラブルで非同期な科学ネイティブな物理世界モデルを進展させる。