著者は、テキスト専用のNemotron 3.5 LightningモデルにNVIDIAのNemotron-3-Nano-Omniから事前学習済みのプロジェクターを取り付けることで、追加のトレーニングなしで画像と音声の理解を可能にするNemotron 3.5 Lightning-Omniを作成しました。

このアプローチが機能するのは、両方のモデルが正確なバックボーン幾何学(nemotron_h、隠れ層2688、52層)を共有しているためです。提供元となるOmniのプロジェクターは、C-RADIOの視覚特徴とParakeetの音声特徴を、Lightningがすでに使用している埋め込み空間に変換します。主な発見は以下の通りです:

  • テキストと形状の読み取りにおいて、画像理解は提供元モデルと完全に一致します。
  • 音声性能では、提供元の2.6%に対して7.9%の単語誤り率を示しましたが、エラーは稀な固有名詞に限定されています。
  • ビデオサポートは実験的段階です。機能しますが、時間的パッチ経路の潜在的なドリフトにより黒画面を報告することが多いです。
  • DGX Spark上でのデコード速度は60〜69 tok/sで変更されていません。

このリリースは、知覚能力が切り離して、アーキテクチャファミリー内のnemotron_h幾何学を共有する将来のチェックポイントに再接続できることを示す存在証明として機能します。