Разработчик выпустил полный пакет GGUF для модели NVIDIA Nemotron-3-Nano-Omni-30B, добавив ранее отсутствующую поддержку аудио и видео в экосистему llama.cpp. Релиз включает девять вариантов квантования от Q3_K_M до BF16 и единый файл проектора, объединяющий энкодеры зрения C-RADIO и аудио Parakeet.
- Выделенный форк llama.cpp реализует граф аудио Parakeet/FastConformer и граф видео C-RADIO, что позволяет осуществлять однократную обработку видео с его звуковой дорожкой.
- Граф видео соответствует эталонной реализации NVIDIA на PyTorch с относительной ошибкой L2 в 0,0019 процента, а граф аудио транскрибирует тестовое озвучивание слово в слово.
- Предварительно собранные бинарные файлы CUDA 13 для Linux arm64 предоставлены для такого оборудования, как DGX Spark и Jetson Thor.
Это обновление позволяет пользователям одновременно запускать модальности изображения, текста, аудио и видео через один экземпляр llama-server на совместимом оборудовании.