作者通过将 NVIDIA 的 Nemotron-3-Nano-Omni 的预训练投影器附加到仅文本的 Nemotron 3.5 Lightning 模型,创建了 Nemotron 3.5 Lightning-Omni,无需任何额外训练即可实现图像和音频理解。
这种方法之所以有效,是因为两个模型共享完全相同的骨干几何结构(nemotron_h,隐藏层维度 2688,52 层)。捐赠者 Omni 的投影器将 C-RADIO 视觉特征和 Parakeet 音频特征转换到 Lightning 已经使用的嵌入空间。主要发现包括:
- 在文本和形状读取方面,图像理解能力与捐赠者模型完全一致。
- 音频性能显示字错误率为 7.9%,而捐赠者为 2.6%,错误仅限于罕见专有名词。
- 视频支持处于实验阶段;虽然功能正常,但由于时间补丁路径可能存在漂移,经常报告黑屏。
- 在 DGX Spark 上,解码速度保持在 60-69 tok/s 不变。
此次发布证明了感知能力可以解耦并附加到架构家族中任何共享 nemotron_h 几何结构的未来检查点。