NVIDIA发布了Alpamayo 2 Super,这是一款在OpenMDW-1.1许可下发布的、专为Robotaxi和自动驾驶设计的340亿参数视觉-语言-动作(VLA)模型。该模型通过结合32B Cosmos 3 Super Reasoner骨干网络与2.3B基于扩散的动作解码器,从多摄像头视频中生成轨迹、因果解释和元动作,以应对长尾事件。
- Alpamayo 2 Super在LingoQA上排名第一,Lingo-Judge得分为79.2,优于Qwen2.5-VL 72B、Gemini 2.5 Pro和GPT-4o。
- 该模型使用约115,000小时的驾驶视频和超过十亿张图像进行训练,其中包括370万条因果链(Chain-of-Causation)轨迹。
- 它通过单次前向传播生成五个输出:轨迹、CoC轨迹、元动作、推理自动标签以及带有2D定位的视觉问答。
- 在AlpaSim上的闭环评估得分为1.50 ± 0.13,而开环测试在6.4秒时达到了0.911m的minADE₆。
该发布允许商业使用和重新分发,无需额外许可。NVIDIA表示,当用作专有车队数据的自动标注器时,该模型可将标注周期从数月缩短至数天。