NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B वॉइस चैट मॉडल उपलब्ध कराया है। रिपॉजिटरी को पूर्ण डुप्लेक्स संचार क्षमताओं का समर्थन करने के रूप में वर्णित किया गया है।
NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B मॉडल जारी किया
NVIDIA ने ओपन-वेट Nemotron 3 डायरिज़ेशन मॉडल जारी किया
NVIDIA ने रियल-टाइम स्पीकर डायरिज़ेशन के लिए एक ओपन-वेट, 100M-पैरामीटर वाला मॉडल Nemotron 3 Diarization जारी किया है जो आठ स्पीकर्स तक का समर्थन करता है। यह मॉडल VoiceArena के डायरिज़ेशन-बेंच लीडरबोर्ड पर #1 स्थान पर है, जिसमें 14.72% डायरिज़ेशन एरर रेट (DER) है, जो अगले रैंक वाले सिस्टम की तुलना में लगभग 24% सापेक्ष कमी दिखाता है।
NVIDIA Magpie TTS में अरबी, कोरियाई, पुर्तगाली जोड़े गए और गुणवत्ता में सुधार
NVIDIA ने अपने Magpie Multilingual TTS मॉडल में एक अपडेट जारी किया है, जिसमें आधुनिक मानक अरबी, कोरियाई और ब्राज़ीलियन पुर्तगाली के जुड़ने के साथ दस भाषाओं का समर्थन बढ़ाकर बारह कर दिया गया है। इस रिलीज में अपडेटेड ट्रेनिंग डेटा और आर्किटेक्चरल बदलावों के माध्यम से मौजूदा भाषाओं में गुणवत्ता में भी सुधार शामिल है।
NVIDIA ने NemotronLabs VoiceChat 11B जारी किया, जो ~450 ms टर्न-टेकिंग के साथ एक खुला फुल-डप्लेक्स स्पीच-टू-स्पीच मॉडल है
NVIDIA ने NemotronLabs VoiceChat 11B जारी किया है, जो रियल-टाइम, फुल-डप्लेक्स संवाद के लिए डिज़ाइन किया गया एक खुला 11B पैरामीटर एंड-टू-एंड स्पीच-टू-स्पीच मॉडल है। कैस्केडेड स्टैक के विपरीत जो ASR, LLM, और TTS को चेन करते हैं, यह यूनिफाइड नेटवर्क एक साथ स्ट्रीमिंग स्पीच समझ और जनरेशन करता है, जिसने Full-Duplex-Bench 1.0 पर मापा गया स्मूथ टर्न-टेकिंग लेटेंसी 448 ms प्राप्त किया।
Nvidia ने Nemotron-Labs-Audex-30B-A3B एकत्रीकृत ऑडियो-टेक्स्ट LLM जारी किया
Nvidia ने Nemotron-Cascade-2-30B-A3B टेक्स्ट-मात्र MoE बैकबोन पर निर्मित Nemotron-Labs-Audex-30B-A3B, एक एकत्रीकृत ऑडियो-टेक्स्ट बड़ा भाषा मॉडल जारी किया है। मॉडल इनपुट के लिए ऑडियो एन्कोडर और आउटपुट के लिए विविक्त ऑडियो टोकन के साथ मौजूदा आर्किटेक्चर का विस्तार करता है, जिससे स्पीच रिकग्निशन, अनुवाद, टेक्स्ट-टू-स्पीच और ऑडियो जनरेशन में क्षमताएं सक्षम होती हैं।
NemotronLabs ने VoiceChat जारी किया, जो टूल कॉलिंग के साथ एक खुला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है
NemotronLabs ने VoiceChat का परिचय दिया, जो एक खुले वजन वाला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है जिसे एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर सुनने, ट्रांसक्रिप्शन, तर्क और बोलने को एकीकृत करने के लिए डिज़ाइन किया गया है। सिस्टम में एक स्ट्रीमिंग स्पीच एन्कोडर और डिकोडर-केवल भाषा मॉडल का संयोजन शामिल है, जिसमें एजेंट टेक्स्ट और संरचित फ़ंक्शन कॉल्स के लिए समानांतर विशेष आउटपुट स्ट्रीम्स हैं, साथ ही एक सहायक RNN-T शाखा है जो क्रमिक उपयोगकर्ता ट्रांसक्रिप्शन के लिए है।