NVIDIA telah merilis Alpamayo 2 Super, model visi-bahasa-aksi (VLA) dengan 34 miliar parameter yang dirancang untuk robotaxi dan pengemudi otonom di bawah lisensi OpenMDW-1.1. Model ini menargetkan peristiwa ekor panjang dengan menggabungkan tulang punggung Cosmos 3 Super Reasoner berukuran 32B dengan decoder aksi berbasis difusi berukuran 2,3B untuk menghasilkan lintasan, penjelasan kausal, dan meta-aksi dari video multi-kamera.
- Alpamayo 2 Super menduduki peringkat pertama di LingoQA dengan skor Lingo-Judge sebesar 79,2, mengungguli Qwen2.5-VL 72B, Gemini 2.5 Pro, dan GPT-4o.
- Model ini dilatih pada sekitar 115.000 jam video berkendara dan lebih dari satu miliar gambar, termasuk 3,7 juta jejak Chain-of-Causation.
- Model ini menghasilkan lima keluaran dari satu kali proses: lintasan, jejak CoC, meta-aksi, auto-label penalaran, dan pertanyaan visual dengan grounding 2D.
- Evaluasi loop tertutup di AlpaSim menghasilkan skor 1,50 ± 0,13, sementara pengujian loop terbuka mencapai minADE₆ sebesar 0,911m pada 6,4 detik.
Rilis ini memungkinkan penggunaan komersial dan redistribusi tanpa izin tambahan, dan NVIDIA menyatakan bahwa model ini dapat memadatkan siklus anotasi dari berbulan-bulan menjadi beberapa hari ketika digunakan sebagai autolabeler untuk data armada milik sendiri.