Un développeur a publié un package GGUF complet pour le modèle Nemotron-3-Nano-Omni-30B de NVIDIA, ajoutant le support audio et vidéo précédemment manquant à l'écosystème llama.cpp. La publication comprend neuf quantisations allant de Q3_K_M à BF16 et un fichier de projecteur unifié qui intègre les encodeurs visuels C-RADIO et audio Parakeet.
- Une fork dédiée de llama.cpp implémente le graphe audio Parakeet/FastConformer et le graphe vidéo C-RADIO, permettant le traitement en un seul passage des vidéos avec leur bande son.
- Le graphe vidéo correspond à la référence PyTorch de NVIDIA avec une erreur L2 relative de 0,0019 %, tandis que le graphe audio transcrit le récit test mot pour mot.
- Des binaires précompilés Linux arm64 CUDA 13 sont fournis pour du matériel tel que DGX Spark et Jetson Thor.
Cette mise à jour permet aux utilisateurs d'exécuter simultanément les modalités image, texte, audio et vidéo via une seule instance llama-server sur du matériel compatible.