El autor aborda las fallas silenciosas en las versiones populares de GGUF de Nemotron-3-Nano-Omni-30B, donde las entradas de audio y vídeo eran ignoradas debido a archivos de proyección incompletos y gráficos de inferencia faltantes. Para solucionar esto, se ha publicado un archivo mmproj unificado que contiene la torre de visión, el codificador de audio Parakeet/FastConformer completo y el incrustador temporal de vídeo, junto con un fork especializado de llama.cpp.

  • El nuevo mmproj combina la torre de visión C-RADIO, el codificador de audio FastConformer de 24 capas y las incrustaciones temporales de parches de vídeo en un solo archivo.
  • Un fork dedicado de llama.cpp implementa los gráficos de inferencia de audio y vídeo necesarios, incluyendo soporte para la poda de tokens EVS.
  • La verificación confirma que el gráfico de vídeo coincide con la referencia de PyTorch de NVIDIA con un error L2 relativo del 0.0019 por ciento y una paridad exacta de EVS.
  • El modelo está disponible en nueve cuantizaciones en Hugging Face, mientras que el audio y el vídeo requieren actualmente los binarios del fork de llama.cpp.

Esta actualización permite a los usuarios procesar entradas de imagen, audio y vídeo simultáneamente en un solo pase, con futuras versiones upstream planificadas para integrar el diseño del proyector de audio.