Dyna Robotics는 시점 인간 영상 100만 시간 이상으로 사전 학습된 로봇 조작용 월드 액션 모델인 Dyna-2를 출시했습니다. 동사는 1,000시간에서 1,000,000시간까지의 스케일링 법칙을 확립함으로써 일반 인간 영상이 액션 레이블 데이터의 대체재가 될 수 있음을 입증했습니다.

  • Dyna-2는 미래 영상과 액션 청크를 공동으로 디노이징하는 비디오 확산 백본을 사용하는 생성 모델입니다.
  • 이 모델은 인간 데이터에서 스케일링 법칙을 보이며, 두 개의 고정형 양팔 플랫폼 간 미시도 로봇 작업에 제로샷 전이가 가능합니다.
  • 영상과 액션의 공동 디노이징은 액션 전용 학습보다 우수하며, 영상은 특히 교차 임베디먼트 일반화에 도움이 됩니다.
  • 14개 작업에 대한 사후 학습 결과, 데이터가 100만 시간으로 스케일됨에 따라 평균 정규화 점수가 20%에서 53%로 상승했습니다.
  • Dyna-2는 이전 Dyna-1 모델의 46%와 비교해 미시도 고객 사이트 중 87%에서 생산 기준을 충족했습니다.

이 연구는 영상 예측이 로봇 데이터로의 전이를 주도하며, 비용이 많이 드는 원격 조작에 의존하는 대신 방대한 양의 레이블 없는 인간 경험으로부터 학습할 수 있음을 시사합니다.