O Shanghai AI Laboratory apresentou o InternW0, a primeira instância da série de modelos de mundo físico InternW, projetada para manter previsões acionáveis em ambientes dinâmicos. O modelo aprende conjuntamente a dinâmica visual futura e o controle contínuo de robôs usando uma arquitetura de vídeo-ação assimétrica com correspondência de fluxo.

  • O InternW0 emprega um especialista de vídeo de alta capacidade para contexto de longo prazo e um especialista de ação leve para escalas de tempo mais rápidas.
  • Ele reutiliza os estados K/V camada por camada e os adapta a novas observações por meio de roteamento de contexto, evitando a regeneração para cada atualização.
  • O treinamento utilizou aproximadamente 7.200 horas de dados heterogêneos de robôs e visão egocêntrica, incluindo o conjunto de dados EgoLab de 275 horas.
  • A avaliação incluiu um fluxo de trabalho de síntese de estruturas metal-orgânicas em 15 etapas e manipulação destreza sensível ao contato em 5 etapas.

Esses resultados avançam modelos de mundo físico escaláveis, assíncronos e nativos da ciência para interações universais e eficientes no mundo real.