NVIDIA ने NemotronLabs VoiceChat 11B जारी किया है, जो रियल-टाइम, फुल-डप्लेक्स संवाद के लिए डिज़ाइन किया गया एक खुला 11B पैरामीटर एंड-टू-एंड स्पीच-टू-स्पीच मॉडल है। कैस्केडेड स्टैक के विपरीत जो ASR, LLM, और TTS को चेन करते हैं, यह यूनिफाइड नेटवर्क एक साथ स्ट्रीमिंग स्पीच समझ और जनरेशन करता है, जिसने Full-Duplex-Bench 1.0 पर मापा गया स्मूथ टर्न-टेकिंग लेटेंसी 448 ms प्राप्त किया।

  • आर्किटेक्चर में एक फास्ट कॉन्फॉर्मर एनकोडर, Nemotron Nano v2 LLM बैकबोन, और एक NVIDIA TTS डिकोडर शामिल है, जिसे लगभग 550k घंटे के ऑडियो पर प्रशिक्षित किया गया।
  • यह <TOOLCALL> स्क्रिप्ट्स के लिए एक अलग आउटपुट चैनल के माध्यम से लाइव टूल कॉलिंग का समर्थन करता है, जिससे ऑपरेटर "ऑन-होल्ड" संदेश परिभाषित कर सकते हैं ताकि API कॉल के दौरान डेड एयर को रोका जा सके।
  • मॉडल उपयोगकर्ताओं को 480 ms पर 1.00 के टेक-ओवर रेट के साथ मध्य-टर्न में बार्ज इन करने की अनुमति देता है, और VoiceBench पर ओपन फुल-डप्लेक्स मॉडल में #2 स्थान पर है।
  • वेट्स परमिसिव OpenMDW-1.1 लाइसेंस के तहत उपलब्ध हैं, लेकिन NVIDIA चेकपॉइंट को ज्ञात विफलता मोड जैसे कॉन्टेक्स्ट सीलिंग लिमिट के कारण केवल शोध उद्देश्यों के लिए तैयार बताता है।
  • डिप्लॉयमेंट के लिए कम से कम 80 GB VRAM वाले एकल GPU, जैसे A100 या H100 की आवश्यकता होती है, और वर्तमान में कोई होस्टेड API प्रदान नहीं किया गया है।

रिलीज संपर्क केंद्रों, ऑटोमोटिव असिस्टेंट्स, और एक्सेसिबिलिटी टूलिंग में पायलट के लिए एक डिप्लॉय करने योग्य विकल्प प्रदान करती है, हालांकि इसे अभी उत्पादन उपयोग के लिए अनुशंसित नहीं किया गया है।