O autor aborda falhas silenciosas nas versões populares do GGUF do Nemotron-3-Nano-Omni-30B, onde as entradas de áudio e vídeo eram ignoradas devido a arquivos de projetor incompletos e gráficos de inferência ausentes. Para corrigir isso, um arquivo mmproj unificado contendo a torre de visão, o codificador de áudio FastConformer completo e o incorporador de vídeo temporal foi lançado junto com um fork especializado do llama.cpp.

  • O novo mmproj combina a torre de visão C-RADIO, o codificador de áudio FastConformer de 24 camadas e as incorporações de patch de vídeo temporal em um único arquivo.
  • Um fork dedicado do llama.cpp implementa os gráficos de inferência de áudio e vídeo necessários, incluindo suporte para poda de tokens EVS.
  • A verificação confirma que o gráfico de vídeo corresponde à referência PyTorch da NVIDIA com erro L2 relativo de 0,0019 por cento e paridade exata do EVS.
  • O modelo está disponível em nove quantizações no Hugging Face, enquanto áudio e vídeo atualmente exigem os binários do llama.cpp forkado.

Esta atualização permite que os usuários processem entradas de imagem, áudio e vídeo simultaneamente em uma única passagem, com lançamentos futuros planejados para integrar o layout do projetor de áudio.