NVIDIA ha lanzado Alpamayo 2 Super, un modelo de visión-lenguaje-acción (VLA) de 34 mil millones de parámetros diseñado para robotaxis y conducción autónoma bajo la licencia OpenMDW-1.1. El modelo aborda eventos de cola larga combinando una base Cosmos 3 Super Reasoner de 32B con un decodificador de acciones basado en difusión de 2.3B para generar trayectorias, explicaciones causales y meta-acciones a partir de video multicámara.

  • Alpamayo 2 Super ocupa el primer lugar en LingoQA con una puntuación Lingo-Judge de 79.2, superando a Qwen2.5-VL 72B, Gemini 2.5 Pro y GPT-4o.
  • El modelo fue entrenado con aproximadamente 115.000 horas de video de conducción y más de mil millones de imágenes, incluyendo 3,7 millones de trazas Chain-of-Causation.
  • Produce cinco salidas en un solo pase: trayectoria, traza CoC, meta-acción, autoetiquetas de razonamiento y respuesta a preguntas visuales con anclaje 2D.
  • La evaluación en bucle cerrado en AlpaSim obtuvo una puntuación de 1.50 ± 0.13, mientras que las pruebas en bucle abierto lograron un minADE₆ de 0.911m a los 6.4 segundos.

El lanzamiento permite el uso comercial y la redistribución sin permiso adicional, y NVIDIA afirma que el modelo puede comprimir los ciclos de anotación de meses a días cuando se usa como autolabeler para datos de flota propietarios.