NVIDIA a publié Alpamayo 2 Super, un modèle vision-langage-action (VLA) de 34 milliards de paramètres conçu pour les robotaxis et la conduite autonome sous la licence OpenMDW-1.1. Le modèle cible les événements à longue traîne en combinant une colonne vertébrale Cosmos 3 Super Reasoner de 32 milliards de paramètres avec un décodeur d'actions basé sur la diffusion de 2,3 milliards de paramètres pour générer des trajectoires, des explications causales et des méta-actions à partir de vidéos multi-caméras.
- Alpamayo 2 Super se classe premier sur LingoQA avec un score Lingo-Judge de 79,2, surpassant Qwen2.5-VL 72B, Gemini 2.5 Pro et GPT-4o.
- Le modèle a été entraîné sur environ 115 000 heures de vidéos de conduite et plus d'un milliard d'images, dont 3,7 millions de traces Chain-of-Causation.
- Il produit cinq sorties en un seul passage : trajectoire, trace CoC, méta-action, auto-étiquetage du raisonnement et questionnement visuel avec ancrage 2D.
- L'évaluation en boucle fermée sur AlpaSim a obtenu un score de 1,50 ± 0,13, tandis que les tests en boucle ouverte ont atteint un minADE₆ de 0,911 m à 6,4 secondes.
La publication permet l'utilisation commerciale et la redistribution sans autorisation supplémentaire, et NVIDIA indique que le modèle peut compresser les cycles d'annotation de mois à jours lorsqu'il est utilisé comme auto-étiqueteur pour des données de flotte propriétaires.