NVIDIA ha lanzado Alpamayo 2 Super, un modelo de visión-lenguaje-acción (VLA) de 34 mil millones de parámetros diseñado para robotaxis y conducción autónoma bajo la licencia OpenMDW-1.1. El modelo aborda eventos de cola larga combinando una base Cosmos 3 Super Reasoner de 32B con un decodificador de acciones basado en difusión de 2.3B para generar trayectorias, explicaciones causales y meta-acciones a partir de video multicámara.
- Alpamayo 2 Super ocupa el primer lugar en LingoQA con una puntuación Lingo-Judge de 79.2, superando a Qwen2.5-VL 72B, Gemini 2.5 Pro y GPT-4o.
- El modelo fue entrenado con aproximadamente 115.000 horas de video de conducción y más de mil millones de imágenes, incluyendo 3,7 millones de trazas Chain-of-Causation.
- Produce cinco salidas en un solo pase: trayectoria, traza CoC, meta-acción, autoetiquetas de razonamiento y respuesta a preguntas visuales con anclaje 2D.
- La evaluación en bucle cerrado en AlpaSim obtuvo una puntuación de 1.50 ± 0.13, mientras que las pruebas en bucle abierto lograron un minADE₆ de 0.911m a los 6.4 segundos.
El lanzamiento permite el uso comercial y la redistribución sin permiso adicional, y NVIDIA afirma que el modelo puede comprimir los ciclos de anotación de meses a días cuando se usa como autolabeler para datos de flota propietarios.