Penulis telah membuat Nemotron 3.5 Lightning-Omni dengan menempelkan projector pra-latihan dari NVIDIA’s Nemotron-3-Nano-Omni ke model teks-saja Nemotron 3.5 Lightning, memungkinkan pemahaman gambar dan audio tanpa pelatihan tambahan.
Pendekatan ini bekerja karena kedua model berbagi geometri backbone yang sama persis (nemotron_h, tersembunyi 2688, 52 lapisan). Projector Omni donor menerjemahkan fitur visi C-RADIO dan fitur audio Parakeet ke dalam ruang embedding yang sudah digunakan Lightning. Temuan kunci meliputi:
- Pemahaman gambar cocok dengan model donor secara persis pada pembacaan teks dan bentuk.
- Kinerja audio menunjukkan tingkat kesalahan kata sebesar 7,9 persen dibandingkan dengan 2,6 persen dari donor, dengan kesalahan terbatas pada nama diri langka.
- Dukungan video bersifat eksperimental; meskipun berfungsi, sering melaporkan layar hitam karena potensi drift dalam jalur patch temporal.
- Kecepatan decode tetap tidak berubah di 60-69 tok/s pada DGX Spark.
Rilis ini berfungsi sebagai bukti keberadaan bahwa kemampuan persepsi dapat dilepas dan ditempelkan ke checkpoint masa depan apa pun yang berbagi geometri nemotron_h dalam keluarga arsitektur.