Um desenvolvedor lançou um pacote GGUF completo para o modelo Nemotron-3-Nano-Omni-30B da NVIDIA, adicionando suporte a áudio e vídeo anteriormente ausente ao ecossistema llama.cpp. O lançamento inclui nove quantizações que variam de Q3_K_M a BF16 e um arquivo de projetor unificado que integra os codificadores de visão C-RADIO e de áudio Parakeet.
- Um fork dedicado do llama.cpp implementa o grafo de áudio Parakeet/FastConformer e o grafo de vídeo C-RADIO, permitindo o processamento em uma única passada de vídeos com sua trilha sonora.
- O grafo de vídeo corresponde à referência PyTorch da NVIDIA com erro L2 relativo de 0,0019%, enquanto o grafo de áudio transcreve a narração de teste palavra por palavra.
São fornecidos binários pré-compilados para Linux arm64 CUDA 13 para hardware como DGX Spark e Jetson Thor.
Esta atualização permite que os usuários executem simultaneamente as modalidades de imagem, texto, áudio e vídeo por meio de uma única instância do llama-server em hardware compatível.