एक डेवलपर ने NVIDIA के Nemotron-3-Nano-Omni-30B मॉडल के लिए एक पूर्ण GGUF पैकेज जारी किया है, जिसने llama.cpp इकोसिस्टम में पहले गायब ऑडियो और वीडियो समर्थन जोड़ा है। रिलीज़ में Q3_K_M से BF16 तक की नौ क्वांटाइज़ेशन और एक एकीकृत प्रोजेक्टर फ़ाइल शामिल है जो C-RADIO विजन और Parakeet ऑडियो एन्कोडर दोनों को एकीकृत करती है।

  • एक समर्पित llama.cpp फोर्क Parakeet/FastConformer ऑडियो ग्राफ़ और C-RADIO वीडियो ग्राफ़ को लागू करता है, जिससे अपनी ध्वनि पट्टी के साथ वीडियो का एक-पास प्रसंस्करण संभव होता है।
  • वीडियो ग्राफ़ NVIDIA के PyTorch रेफ़रेंस से 0.0019 प्रतिशत सापेक्ष L2 त्रुटि तक मेल खाता है, जबकि ऑडियो ग्राफ़ परीक्षण कथन को शब्द-दर-शब्द ट्रांसक्राइब करता है।
  • DGX Spark और Jetson Thor जैसे हार्डवेयर के लिए पूर्व-निर्मित Linux arm64 CUDA 13 बाइनरी प्रदान की गई हैं।

इस अपडेट से उपयोगकर्ता संगत हार्डवेयर पर एकल llama-server इंस्टेंस के माध्यम से छवि, पाठ, ऑडियो और वीडियो मोडैलिटीज़ को एक साथ चला सकते हैं।