NVIDIA ने OpenMDW-1.1 लाइसेंस के तहत रोबोटैक्स और स्वचालित ड्राइविंग के लिए डिज़ाइन किए गए 34-अरब पैरामीटर वाले विजन-लैंग्वेज-एक्शन (VLA) मॉडल Alpamayo 2 Super को जारी किया है। मॉडल मल्टी-कैमरा वीडियो से ट्रेजेक्टरी, कारण स्पष्टीकरण और मेटा-एक्शन उत्पन्न करने के लिए 32B Cosmos 3 Super Reasoner बैकबोन को 2.3B डिफ्यूजन-आधारित एक्शन डिकोडर के साथ जोड़कर लॉन्ग-टेल इवेंट्स पर ध्यान केंद्रित करता है।

  • Alpamayo 2 Super Lingo-Judge स्कोर 79.2 के साथ LingoQA पर पहले स्थान पर है, जिसने Qwen2.5-VL 72B, Gemini 2.5 Pro और GPT-4o को पीछे छोड़ दिया।
  • मॉडल का प्रशिक्षण लगभग 115,000 घंटे के ड्राइविंग वीडियो और एक अरब से अधिक छवियों पर किया गया था, जिसमें 3.7 मिलियन Chain-of-Causation ट्रेस शामिल हैं।
  • यह एकल पास से पांच आउटपुट उत्पन्न करता है: ट्रेजेक्टरी, CoC ट्रेस, मेटा-एक्शन, तर्क ऑटो-लेबल्स और 2D ग्रौंडिंग के साथ विज़ुअल क्वेश्चन एंस्विंग।
  • AlpaSim पर क्लोज्ड-लूप इवल्यूएशन में 1.50 ± 0.13 का स्कोर मिला, जबकि ओपन-लूप टेस्टिंग ने 6.4 सेकंड पर minADE₆ के लिए 0.911m हासिल किया।

इस रिलीज में बिना अतिरिक्त अनुमति के वाणिज्यिक उपयोग और पुनर्वितरण की अनुमति है, और NVIDIA का कहना है कि जब इसे प्रोप्राइटरी फ्लीट डेटा के लिए ऑटोलैबलर के रूप में उपयोग किया जाता है तो यह एनोटेशन चक्र को महीनों से दिनों तक कम कर सकता है।