Un développeur a publié un package GGUF complet pour le modèle Nemotron-3-Nano-Omni-30B de NVIDIA, ajoutant le support audio et vidéo précédemment manquant à l'écosystème llama.cpp. La publication comprend neuf quantisations allant de Q3_K_M à BF16 et un fichier de projecteur unifié qui intègre les encodeurs visuels C-RADIO et audio Parakeet.

  • Une fork dédiée de llama.cpp implémente le graphe audio Parakeet/FastConformer et le graphe vidéo C-RADIO, permettant le traitement en un seul passage des vidéos avec leur bande son.
  • Le graphe vidéo correspond à la référence PyTorch de NVIDIA avec une erreur L2 relative de 0,0019 %, tandis que le graphe audio transcrit le récit test mot pour mot.
  • Des binaires précompilés Linux arm64 CUDA 13 sont fournis pour du matériel tel que DGX Spark et Jetson Thor.

Cette mise à jour permet aux utilisateurs d'exécuter simultanément les modalités image, texte, audio et vidéo via une seule instance llama-server sur du matériel compatible.