O autor criou o Nemotron 3.5 Lightning-Omni anexando projetores pré-treinados do Nemotron-3-Nano-Omni da NVIDIA ao modelo Nemotron 3.5 Lightning apenas para texto, permitindo compreensão de imagens e áudio sem nenhum treinamento adicional.

Essa abordagem funciona porque ambos os modelos compartilham a mesma geometria de backbone (nemotron_h, hidden 2688, 52 camadas). Os projetores do Omni doador traduzem as características de visão C-RADIO e as características de áudio Parakeet para o espaço de embedding que o Lightning já utiliza. Principais descobertas incluem:

  • A compreensão de imagens corresponde exatamente ao modelo doador na leitura de texto e formas.
  • O desempenho de áudio apresenta uma taxa de erro de palavras de 7,9% em comparação com os 2,6% do doador, com erros limitados a nomes próprios raros.
  • O suporte a vídeo é experimental; embora funcional, frequentemente relata telas pretas devido a possíveis desvios no caminho de patch temporal.
  • A velocidade de decodificação permanece inalterada em 60-69 tok/s em um DGX Spark.

O lançamento serve como uma prova de existência de que capacidades de percepção podem ser desconectadas e anexadas a qualquer checkpoint futuro que compartilhe a geometria nemotron_h dentro da família de arquiteturas.