L'auteur a créé Nemotron 3.5 Lightning-Omni en attachant des projecteurs pré-entraînés de Nemotron-3-Nano-Omni de NVIDIA au modèle textuel uniquement Nemotron 3.5 Lightning, permettant la compréhension d'images et d'audio sans aucun entraînement supplémentaire.

Cette approche fonctionne car les deux modèles partagent exactement la même géométrie de base (nemotron_h, caché 2688, 52 couches). Les projecteurs de l'Omni donneur traduisent les caractéristiques visuelles C-RADIO et les caractéristiques audio Parakeet dans l'espace d'embedding que Lightning utilise déjà. Les résultats clés incluent :

  • La compréhension d'images correspond exactement à celle du modèle donneur pour la lecture de texte et de formes.
  • Les performances audio montrent un taux d'erreur de mots de 7,9 % comparé aux 2,6 % du donneur, les erreurs étant limitées aux noms propres rares.
  • Le support vidéo est expérimental ; bien que fonctionnel, il signale souvent des écrans noirs en raison d'une dérive potentielle dans le chemin des patches temporels.
  • La vitesse de décodage reste inchangée à 60-69 tok/s sur un DGX Spark.

La publication sert de preuve d'existence que les capacités de perception peuvent être détachées et attachées à n'importe quel futur checkpoint partageant la géométrie nemotron_h au sein de la famille d'architecture.