NVIDIA는 OpenMDW-1.1 라이선스 하에 로봇택시와 자율주행을 위해 설계된 340억 파라미터의 비전-언어-액션(VLA) 모델인 Alpamayo 2 Super를 출시했습니다. 이 모델은 32B Cosmos 3 Super Reasoner 백본과 2.3B 확산 기반 액션 디코더를 결합하여 다중 카메라 영상에서 궤적, 인과 설명 및 메타 액션을 생성함으로써 롱테일 이벤트에 대응합니다.
- Alpamayo 2 Super는 Lingo-Judge 점수 79.2로 LingoQA에서 1위를 차지했으며, Qwen2.5-VL 72B, Gemini 2.5 Pro, GPT-4o를 능가했습니다.
- 이 모델은 약 115,000시간의 주행 영상과 370만 개의 인과 관계 추적(Chain-of-Causation)을 포함한 10억 장 이상의 이미지로 학습되었습니다.
- 단일 추론에서 궤적, CoC 추적, 메타 액션, 추론 자동 라벨링 및 2D 기반 시각 질문 답변이라는 다섯 가지 출력을 생성합니다.
- AlpaSim에서의 폐루프 평가는 1.50 ± 0.13의 점수를 기록했으며, 개방형 루프 테스트에서는 6.4초 시점에서 minADE₆가 0.911m를 달성했습니다.
이 모델은 추가 허가 없이 상업적 사용과 재배포를 허용하며, NVIDIA는 이를 자체 플릿 데이터의 자동 라벨러로 사용할 때 주석 작성 주기를 개월에서 일로 압축할 수 있다고 밝혔습니다.