저자는 NVIDIA의 Nemotron-3-Nano-Omni에서 사전 훈련된 프로젝터를 텍스트 전용 Nemotron 3.5 Lightning 모델에 연결하여 Nemotron 3.5 Lightning-Omni를 만들었으며, 이는 추가 학습 없이 이미지와 오디오 이해를 가능하게 합니다.

이 접근 방식은 두 모델이 정확한 백본 기하학(nemotron_h, 히든 2688, 52 레이어)을 공유하기 때문에 작동합니다. 제공자 Omni의 프로젝터는 C-RADIO 시각 기능과 Parakeet 오디오 기능을 Lightning이 이미 사용하는 임베딩 공간으로 변환합니다. 주요 발견 사항은 다음과 같습니다:

  • 이미지 이해는 텍스트 및 도형 읽기에서 제공자 모델과 정확히 일치합니다.
  • 오디오 성능은 희귀 고유 명사에 국한된 오류를 제외하고 7.9퍼센트의 단어 오류율을 보이며, 이는 제공자의 2.6퍼센트와 비교됩니다.
  • 비디오 지원은 실험적이며 기능적이지만, 시간적 패치 경로에서의 잠재적 드리프트로 인해 종종 검은 화면을 보고합니다.
  • DGX Spark에서 디코드 속도는 60-69 tok/s로 변경되지 않았습니다.

이 릴리스는 지각 기능이 분리되어 아키텍처 패밀리 내에서 nemotron_h 기하학을 공유하는 모든 미래 체크포인트에 다시 연결될 수 있음을 보여주는 존재 증명 역할을 합니다.