O Shanghai AI Laboratory apresentou o InternW0, a primeira instância da série de modelos de mundo físico InternW, projetada para manter previsões acionáveis em ambientes dinâmicos. O modelo aprende conjuntamente a dinâmica visual futura e o controle contínuo de robôs usando uma arquitetura de vídeo-ação assimétrica com correspondência de fluxo.
- O InternW0 emprega um especialista de vídeo de alta capacidade para contexto de longo prazo e um especialista de ação leve para escalas de tempo mais rápidas.
- Ele reutiliza os estados K/V camada por camada e os adapta a novas observações por meio de roteamento de contexto, evitando a regeneração para cada atualização.
- O treinamento utilizou aproximadamente 7.200 horas de dados heterogêneos de robôs e visão egocêntrica, incluindo o conjunto de dados EgoLab de 275 horas.
- A avaliação incluiu um fluxo de trabalho de síntese de estruturas metal-orgânicas em 15 etapas e manipulação destreza sensível ao contato em 5 etapas.
Esses resultados avançam modelos de mundo físico escaláveis, assíncronos e nativos da ciência para interações universais e eficientes no mundo real.