El autor ha creado Nemotron 3.5 Lightning-Omni adjuntando proyectores preentrenados de Nemotron-3-Nano-Omni de NVIDIA al modelo Nemotron 3.5 Lightning solo de texto, lo que permite la comprensión de imágenes y audio sin ningún entrenamiento adicional.

Este enfoque funciona porque ambos modelos comparten exactamente la misma geometría del backbone (nemotron_h, oculto 2688, 52 capas). Los proyectores del Omni donante traducen las características visuales C-RADIO y las características de audio Parakeet al espacio de incrustación que Lightning ya utiliza. Los hallazgos clave incluyen:

  • La comprensión de imágenes coincide exactamente con el modelo donante en la lectura de texto y forma.
  • El rendimiento de audio muestra una tasa de error de palabras del 7,9 por ciento en comparación con el 2,6 por ciento del donante, con errores limitados a sustantivos propios raros.
  • El soporte para video es experimental; aunque funcional, a menudo informa pantallas negras debido a una posible deriva en la vía de parches temporales.
  • La velocidad de decodificación permanece sin cambios en 60-69 tok/s en un DGX Spark.

El lanzamiento sirve como una prueba de existencia de que las capacidades de percepción pueden desvincularse y adjuntarse a cualquier punto de control futuro que comparta la geometría nemotron_h dentro de la familia de arquitecturas.