NOVA-VAD, एक हल्का और व्याख्या योग्य वॉयस एक्टिविटी डिटेक्टर, UrbanSound8K डेटासेट से शोर भरे ऑडियो पर 93% सटीकता प्राप्त करता है, जो WebRTC (58%), Pyannote (62%) और Silero (87%) को पीछे छोड़ता है। यह केवल scikit-learn का उपयोग करता है, GPU की आवश्यकता नहीं होती है, और साधारण अंग्रेजी में फीचर महत्व और आत्मविश्वास स्कोर प्रदान करता है।
शोर भरे ऑडियो पर NOVA-VAD ने 93% सटीकता के साथ Silero, Pyannote और WebRTC को हराया
NVIDIA Magpie TTS में अरबी, कोरियाई, पुर्तगाली जोड़े गए और गुणवत्ता में सुधार
NVIDIA ने अपने Magpie Multilingual TTS मॉडल में एक अपडेट जारी किया है, जिसमें आधुनिक मानक अरबी, कोरियाई और ब्राज़ीलियन पुर्तगाली के जुड़ने के साथ दस भाषाओं का समर्थन बढ़ाकर बारह कर दिया गया है। इस रिलीज में अपडेटेड ट्रेनिंग डेटा और आर्किटेक्चरल बदलावों के माध्यम से मौजूदा भाषाओं में गुणवत्ता में भी सुधार शामिल है।
NVIDIA ने NemotronLabs VoiceChat 11B जारी किया, जो ~450 ms टर्न-टेकिंग के साथ एक खुला फुल-डप्लेक्स स्पीच-टू-स्पीच मॉडल है
NVIDIA ने NemotronLabs VoiceChat 11B जारी किया है, जो रियल-टाइम, फुल-डप्लेक्स संवाद के लिए डिज़ाइन किया गया एक खुला 11B पैरामीटर एंड-टू-एंड स्पीच-टू-स्पीच मॉडल है। कैस्केडेड स्टैक के विपरीत जो ASR, LLM, और TTS को चेन करते हैं, यह यूनिफाइड नेटवर्क एक साथ स्ट्रीमिंग स्पीच समझ और जनरेशन करता है, जिसने Full-Duplex-Bench 1.0 पर मापा गया स्मूथ टर्न-टेकिंग लेटेंसी 448 ms प्राप्त किया।
NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B मॉडल जारी किया
NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B वॉइस चैट मॉडल उपलब्ध कराया है। रिपॉजिटरी को पूर्ण डुप्लेक्स संचार क्षमताओं का समर्थन करने के रूप में वर्णित किया गया है।
Freya-TTS ने 8.0% WER के साथ टोकनाइज़र-मुक्त तुर्की TTS मॉडल जारी किया
शोधकर्ताओं ने Freya-TTS का परिचय दिया, जो तुर्की के लिए अनुकूलित एक कॉम्पैक्ट, टोकनाइज़र-मुक्त टेक्स्ट-टू-स्पीच मॉडल है जो Freya-TR-Eval बेंचमार्क पर 8.0% शब्द त्रुटि दर (WER) प्राप्त करता है। 183.2M पैरामीटर वाले नॉन-ऑटोरेग्रेसिव कंडीशनल फ्लो-मैचिंग डिफ्यूजन ट्रान्सफॉर्मर AudioVAE2 के फ्रोजन कंटिन्यूअस लैटेंट स्पेस में काम करता है, जिससे बिना फोनमाइज़र या डिसक्रिट स्पीच टोकनाइजर के 48 kHz रिकंस्ट्रक्शन उच्च गुणवत्ता प्राप्त होता है।
OpenMOSS ने संयुक्त प्रतिलेखन और डायरिज़ेशन के लिए MOSS-Transcribe-Diarize 0.9B जारी किया
OpenMOSS ने MOSS-Transcribe-Diarize जारी किया है, जो एक 0.9B पैरामीटर वाला एंड-टू-एंड ऑडियो समझ मॉडल है जो लंबे फॉर्म मल्टी-स्पीकर प्रतिलेखन, डायरिज़ेशन, टाइमस्टैम्प्स और अकाउस्टिक इवेंट जागरूकता के लिए डिज़ाइन किया गया है।