قام المؤلف بإنشاء Nemotron 3.5 Lightning-Omni عن طريق ربط مشعّعات مُدرَّبة مسبقًا من Nemotron-3-Nano-Omni التابعة لـ NVIDIA بنموذج Nemotron 3.5 Lightning الخاص بالنص فقط، مما يتيح فهم الصور والصوت دون أي تدريب إضافي.
يعمل هذا النهج لأن النموذجين يشاركان نفس هندسة الهيكل الأساسي تمامًا (nemotron_h، الخفي 2688، 52 طبقة). تقوم مشعّعات Omni المانحة بترجمة ميزات الرؤية الخاصة بـ C-RADIO وميزات الصوت الخاصة بـ Parakeet إلى فضاء التضمين الذي يستخدمه Lightning بالفعل. تشمل النتائج الرئيسية:
- يتطابق فهم الصور مع أداء النموذج المانح تمامًا في قراءة النص والأشكال.
- يُظهر الأداء الصوتي معدل خطأ في الكلمات بنسبة 7.9 بالمائة مقارنة بـ 2.6 بالمائة لدى النموذج المانح، مع حصر الأخطاء في الأسماء العلمية النادرة.
- دعم الفيديو تجريبي؛ فهو يعمل وظيفيًا لكنه غالبًا ما يبلغ عن شاشات سوداء بسبب الانحراف المحتمل في مسار البقع الزمنية.
- يظل سرعة فك التشفير دون تغيير عند 60-69 tok/s على جهاز DGX Spark.
يُعد هذا الإصدار دليلاً على وجود إمكانية فصل قدرات الإدراك وإرفاقها بأي نقطة تفتيش مستقبلية تشارك هندسة nemotron_h ضمن عائلة المعمارية.