Le Shanghai AI Laboratory a présenté InternW0, la première incarnation de sa série de modèles du monde physique InternW, conçue pour maintenir des prédictions exploitables dans des environnements dynamiques. Le modèle apprend conjointement les dynamiques visuelles futures et le contrôle continu des robots à l'aide d'une architecture vidéo-action asymétrique avec appariement par flux.

  • InternW0 utilise un expert vidéo haute capacité pour le contexte à long terme et un expert d'action léger pour des échelles de temps plus rapides.
  • Il réutilise les états K/V par couches et les adapte aux nouvelles observations via un routage contextuel, évitant la régénération à chaque mise à jour.
  • L'entraînement a utilisé environ 7 200 heures de données hétérogènes issues de robots et de perspectives égocentriques, dont le jeu de données EgoLab de 275 heures.
  • L'évaluation comprenait un flux de synthèse de cadres métallo-organiques en 15 étapes et une manipulation délicate consciente du contact en 5 étapes.

Ces résultats font progresser les modèles du monde physique évolutifs, asynchrones et natifs à la science pour des interactions universelles et efficaces dans le monde réel.