상하이 AI 연구소는 동적 환경에서 실행 가능한 예측을 유지하도록 설계된 InternW 물리 세계 모델 시리즈의 첫 번째 구현체인 InternW0를 소개했습니다. 이 모델은 플로우 매칭(flow matching)이 적용된 비대칭 비디오-액션 아키텍처를 사용하여 미래의 시각적 역학과 연속적인 로봇 제어를 함께 학습합니다.
- InternW0는 장기적 맥락을 위한 고용량 비디오 전문가와 더 빠른 시간 척도를 위한 경량 액션 전문가를 사용합니다.
- 레이어별 K/V 상태를 재사용하고 컨텍스트 라우팅을 통해 새로운 관측치에 적응하여, 모든 업데이트마다 재생성을 피합니다.
- 학습에는 275시간의 EgoLab 데이터셋을 포함해 약 7,200시간의 이종 로봇 및 시점(egocentric) 데이터가 사용되었습니다.
- 평가에는 15단계 금속-유기 골격 합성 워크플로우와 5단계 접촉 인식 정교한 조작이 포함되었습니다.
이러한 결과는 보편적이고 효율적인 실제 세계 상호작용을 위한 확장 가능하고 비동기적이며 과학 네이티브한 물리 세계 모델을 발전시킵니다.