Автор создал Nemotron 3.5 Lightning-Omni, прикрепив предварительно обученные проекторы из NVIDIA’s Nemotron-3-Nano-Omni к текстовой модели Nemotron 3.5 Lightning, что позволяет понимать изображения и аудио без дополнительного обучения.

Этот подход работает, потому что обе модели имеют точное совпадение геометрии бэкбона (nemotron_h, скрытый размер 2688, 52 слоя). Проектторы донорской Omni модели переводят визуальные признаки C-RADIO и аудио признаки Parakeet в пространство эмбеддингов, которое уже использует Lightning. Ключевые выводы включают:

  • Понимание изображений точно совпадает с моделью-донором при чтении текста и форм.
  • Производительность аудио показывает 7,9 процента ошибки слов по сравнению с 2,6 процента у донора, при этом ошибки ограничиваются редкими именами собственными.
  • Поддержка видео экспериментальная; хотя она функциональна, часто сообщается о черных экранах из-за возможного дрейфа в временном пути патчей.
  • Скорость декодирования остается неизменной на уровне 60-69 tok/s на DGX Spark.

Выпуск служит доказательством существования того факта, что способности восприятия могут быть отсоединены и присоединены к любому будущему чекпоинту, разделяющему геометрию nemotron_h в рамках семейства архитектур.