A Dyna Robotics lançou o Dyna-2, um modelo de ação no mundo para manipulação robótica que foi pré-treinado com mais de um milhão de horas de vídeo egocêntrico humano. A empresa demonstra que vídeos humanos comuns podem substituir dados rotulados com ações ao estabelecer uma lei de escala de 1.000 a 1.000.000 de horas.

  • O Dyna-2 é um modelo generativo que utiliza uma estrutura base de difusão de vídeo, realizando desruído simultâneo do vídeo futuro e dos blocos de ação.
  • O modelo exibe uma lei de escala nos dados humanos que se transfere para tarefas robóticas não vistas em zero-shot em duas plataformas bimanuais estacionárias.
  • O desruído conjunto de vídeo e ação supera o treinamento apenas com ações, sendo o vídeo especificamente benéfico para a generalização entre diferentes embodieds.
  • O pós-treinamento em 14 tarefas mostrou que as pontuações normalizadas médias subiram de 20% para 53% à medida que os dados escalaram para um milhão de horas.
  • O Dyna-2 atendeu aos critérios de produção em 87% dos locais de clientes não vistos, comparado a 46% do modelo anterior Dyna-1.

A pesquisa indica que a previsão de vídeo impulsiona a transferência para dados robóticos, permitindo que o sistema aprenda com vastas quantidades de experiência humana não rotulada em vez de depender de teleoperação custosa.