Shanghai AI Laboratory ha presentado InternW0, la primera instancia de su serie de modelos del mundo físico InternW, diseñada para mantener predicciones accionables en entornos dinámicos. El modelo aprende conjuntamente la dinámica visual futura y el control continuo de robots mediante una arquitectura asimétrica de video-acción con emparejamiento de flujos.

  • InternW0 emplea un experto de video de alta capacidad para contexto a largo plazo y un experto de acción ligero para escalas de tiempo más rápidas.
  • Reutiliza los estados K/V capa por capa y los adapta a nuevas observaciones mediante enrutamiento de contexto, evitando la regeneración para cada actualización.
  • El entrenamiento utilizó aproximadamente 7.200 horas de datos heterogéneos de robots y egocéntricos, incluyendo el conjunto de datos EgoLab de 275 horas.
  • La evaluación incluyó un flujo de trabajo de síntesis de marcos metal-orgánicos de 15 etapas y una manipulación diestra consciente del contacto de 5 etapas.

Estos resultados avanzan los modelos del mundo físico escalables, asíncronos y nativos para la ciencia, orientados a interacciones universales y eficientes en el mundo real.