A NVIDIA lançou o Alpamayo 2 Super, um modelo de visão-linguagem-ação (VLA) com 34 bilhões de parâmetros projetado para robotáxis e direção autônoma sob a licença OpenMDW-1.1. O modelo aborda eventos de cauda longa ao combinar uma espinha dorsal Cosmos 3 Super Reasoner de 32B com um decodificador de ação baseado em difusão de 2,3B para gerar trajetórias, explicações causais e meta-ações a partir de vídeos de múltiplas câmeras.
- Alpamayo 2 Super ocupa o primeiro lugar no LingoQA com uma pontuação Lingo-Judge de 79,2, superando Qwen2.5-VL 72B, Gemini 2.5 Pro e GPT-4o.
- O modelo foi treinado com aproximadamente 115.000 horas de vídeos de direção e mais de um bilhão de imagens, incluindo 3,7 milhões de rastros Chain-of-Causation.
- Ele produz cinco saídas em uma única passagem: trajetória, rastro CoC, meta-ação, auto-rótulos de raciocínio e resposta a perguntas visuais com fundamentação 2D.
- A avaliação em loop fechado no AlpaSim resultou em uma pontuação de 1,50 ± 0,13, enquanto os testes em loop aberto alcançaram um minADE₆ de 0,911m em 6,4 segundos.
O lançamento permite uso comercial e redistribuição sem permissão adicional, e a NVIDIA afirma que o modelo pode comprimir ciclos de anotação de meses para dias quando usado como autolabeler para dados de frota proprietária.