लेखक ने टेक्स्ट-केवल नेमोट्रॉन 3.5 लाइटनिंग मॉडल में NVIDIA के नेमोट्रॉन-3-नाનો-ओमी से पूर्व-प्रशिक्षित प्रोजेक्टर्स को जोड़कर नेमोट्रॉन 3.5 लाइटनिंग-ओमी बनाया है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के छवि और ऑडियो समझ संभव हुई।
यह दृष्टिकोण इसलिए काम करता है क्योंकि दोनों मॉडल्स में बिल्कुल वही बैकबोन ज्यामिति (nemotron_h, hidden 2688, 52 परतें) साझा होती है। दाता ओमी के प्रोजेक्टर्स C-RADIO दृष्टि विशेषताओं और Parakeet ऑडियो विशेषताओं को उस एम्बेडिंग स्पेस में अनुवादित करते हैं जिसका उपयोग लाइटनिंग पहले से कर रहा है। प्रमुख निष्कर्ष ये हैं:
- टेक्स्ट और आकार पढ़ने पर दृष्टि समझ दाता मॉडल के बिल्कुल बराबर है।
- ऑडियो प्रदर्शन में 7.9 प्रतिशत शब्द त्रुटि दर दिखाई देती है, जबकि दाता की यह दर 2.6 प्रतिशत थी; त्रुटियां दुर्लभ उचित नामों तक सीमित हैं।
- वीडियो समर्थन प्रयोगात्मक है; कार्यक्षम होने के बावजूद, समयिक पैच पथ में संभावित विचलन के कारण अक्सर काली स्क्रीन की रिपोर्ट होती है।
- DGX Spark पर डिकोड गति 60-69 tok/s पर अपरिवर्तित बनी हुई है।
यह रिलीज़ यह अस्तित्व प्रमाण प्रस्तुत करती है कि संवेदनशील क्षमताओं को अलग किया जा सकता है और आर्किटेक्चर परिवार में nemotron_h ज्यामिति साझा करने वाले किसी भी भविष्य के चेकपॉइंट पर जोड़ा जा सकता है।