लेखक नेमोट्रॉन-3-नैनो-ऑम्नी-30B के लोकप्रिय GGUF संस्करणों में मौन विफलताओं पर प्रकाश डालते हैं, जहाँ अपूर्ण प्रोजेक्टर फ़ाइलों और अनुपस्थित इनफरेंस ग्राफ़्स के कारण ऑडियो और वीडियो इनपुट को नज़रअंदाज कर दिया गया था। इस समस्या को हल करने के लिए, विजन टावर, पूर्ण Parakeet/FastConformer ऑडियो एन्कोडर और टेम्पोरल वीडियो एम्बेडर को एक ही फ़ाइल में समेटने वाला एक एकीकृत mmproj फ़ाइल विशेष llama.cpp फ़ॉर्क के साथ जारी की गई है।

  • नया mmproj C-RADIO विजन टावर, 24-परतों वाला FastConformer ऑडियो एन्कोडर और टेम्पोरल वीडियो पैच एम्बेडिंग्स को एक ही फ़ाइल में जोड़ता है।
  • एक समर्पित llama.cpp फ़ॉर्क आवश्यक ऑडियो और वीडियो इनफरेंस ग्राफ़्स को लागू करता है, जिसमें EVS टोकन प्रूनिंग का समर्थन भी शामिल है।
  • सत्यापन पुष्टि करता है कि वीडियो ग्राफ़ NVIDIA के PyTorch संदर्भ से मेल खाता है, जिसमें 0.0019 प्रतिशत सापेक्ष L2 त्रुटि और सटीक EVS समानता है।
  • मॉडल Hugging Face पर नौ क्वांटाइज़ेशन में उपलब्ध है, जबकि ऑडियो और वीडियो के लिए वर्तमान में फ़ोर्क्ड llama.cpp बाइनरी की आवश्यकता है।

यह अपडेट उपयोगकर्ताओं को एक ही पास में छवि, ऑडियो और वीडियो इनपुट को संसाधित करने की अनुमति देता है, और भविष्य के अपस्ट्रीम रिलीज़ में ऑडियो प्रोजेक्टर लेआउट को एकीकृत करने की योजना बनाई गई है।