Dyna Robotics a publié Dyna-2, un modèle d'action-monde pour la manipulation robotique qui a été pré-entraîné sur plus d'un million d'heures de vidéo égocentrique humaine. L'entreprise démontre que la vidéo humaine ordinaire peut remplacer les données étiquetées par action en établissant une loi d'échelle allant de 1 000 à 1 000 000 d'heures.

  • Dyna-2 est un modèle génératif utilisant un noyau de diffusion vidéo qui débruite conjointement la vidéo future et les chunks d'action.
  • Le modèle présente une loi d'échelle sur les données humaines qui se transfère en zero-shot à des tâches robotiques invisibles sur deux plateformes bimanuelles stationnaires.
  • Le débrutage conjoint de la vidéo et de l'action surpasse l'entraînement uniquement sur l'action, la vidéo aidant spécifiquement la généralisation cross-embodiment.
  • L'entraînement postérieur sur 14 tâches a montré des scores normalisés moyens passant de 20 % à 53 % lorsque les données ont atteint un million d'heures.
  • Dyna-2 a réussi les critères de production dans 87 % des sites clients invisibles par rapport à 46 % pour le modèle précédent Dyna-1.

La recherche indique que la prédiction vidéo favorise le transfert vers les données robotiques, permettant au système d'apprendre à partir de vastes quantités d'expérience humaine non étiquetée plutôt que de s'appuyer sur une téléopération coûteuse.