Dyna Robotics ha lanzado Dyna-2, un modelo de acción mundial para manipulación robótica que fue preentrenado con más de un millón de horas de video egocéntrico humano. La empresa demuestra que el video humano ordinario puede sustituir a los datos etiquetados con acciones al establecer una ley de escalado desde 1.000 hasta 1.000.000 de horas.
- Dyna-2 es un modelo generativo que utiliza una arquitectura base de difusión de video que desruido simultáneamente el video futuro y los fragmentos de acción.
- El modelo exhibe una ley de escalado en datos humanos que se transfiere a cero disparos (zero-shot) a tareas robóticas no vistas en dos plataformas bimanuales estacionarias.
- El desruido conjunto de video y acción supera al entrenamiento solo con acciones, siendo el video particularmente útil para la generalización entre diferentes embodimentaciones.
- El post-entrenamiento en 14 tareas mostró que las puntuaciones normalizadas medias aumentaron del 20% al 53% a medida que los datos escalaban hasta un millón de horas.
- Dyna-2 cumplió los criterios de producción en el 87% de los sitios de clientes no vistos, en comparación con el 46% del modelo anterior Dyna-1.
La investigación indica que la predicción de video impulsa la transferencia a datos robóticos, permitiendo al sistema aprender de vastas cantidades de experiencia humana sin etiquetar en lugar de depender de la teleoperación costosa.