Автор создал Nemotron 3.5 Lightning-Omni, прикрепив предварительно обученные проекторы из NVIDIA’s Nemotron-3-Nano-Omni к текстовой модели Nemotron 3.5 Lightning, что позволяет понимать изображения и аудио без дополнительного обучения.
Этот подход работает, потому что обе модели имеют точное совпадение геометрии бэкбона (nemotron_h, скрытый размер 2688, 52 слоя). Проектторы донорской Omni модели переводят визуальные признаки C-RADIO и аудио признаки Parakeet в пространство эмбеддингов, которое уже использует Lightning. Ключевые выводы включают:
- Понимание изображений точно совпадает с моделью-донором при чтении текста и форм.
- Производительность аудио показывает 7,9 процента ошибки слов по сравнению с 2,6 процента у донора, при этом ошибки ограничиваются редкими именами собственными.
- Поддержка видео экспериментальная; хотя она функциональна, часто сообщается о черных экранах из-за возможного дрейфа в временном пути патчей.
- Скорость декодирования остается неизменной на уровне 60-69 tok/s на DGX Spark.
Выпуск служит доказательством существования того факта, что способности восприятия могут быть отсоединены и присоединены к любому будущему чекпоинту, разделяющему геометрию nemotron_h в рамках семейства архитектур.