NemotronLabs ने NemotronLabs VoiceChat का परिचय दिया, जो एक ओपन-वेट पूर्ण-डुप्लेक्स स्पीच-टू-स्पीच मॉडल है जो एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर नेटिव टूल-कॉलिंग क्षमताओं को एकीकृत करता है। सिस्टम एक स्ट्रीमिंग स्पीच एनकोडर और डिकोडर-केवल भाषा मॉडल को एजेंट टेक्स्ट और संरचित फंक्शन कॉल्स के लिए समानांतर आउटपुट स्ट्रीम्स, अतिरिक्त RNN-T ब्रांच जो क्रमिक ट्रांसक्रिप्शन के लिए है और एक स्ट्रीमिंग TTS डिकोडर के साथ जोड़ता है।

  • Full-Duplex-Bench 1.0 पर मूल्यांकन किए गए ओपन-वेट सिस्टमों में सबसे कम पॉज हैंडलिंग टोकओवर दर प्राप्त करता है, जिसमें यूजर इंटरप्शन के बाद 100% टोकओवर और इंटरप्शन के बाद प्रतिक्रिया गुणवत्ता स्कोर 4.33/5 है।
  • Full-Duplex-Bench 1.5 पर 93% मामलों में यूजर बैकचैनल्स के बाद प्रतिक्रियाओं को फिर से शुरू करता है।
  • VoiceBench पर 55.1 नॉर्मलाइज्ड औसत और Full-Duplex-Bench 3.0 पर 82.5% टूल-सिलेक्शन F1 स्कोर प्राप्त करता है, हालांकि आर्गुमेंट सटीकता और एंड-टू-एंड टूल एक्जीक्यूशन में सुधार की आवश्यकता है।

मॉडल यह प्रदर्शित करता है कि पूर्ण-डुप्लेक्स इंटरैक्शन, स्पीच रिकग्निशन और जनरेशन, सामान्य भाषा क्षमताएं और बाहरी टूल उपयोग को एक ही ओपन स्पीच-टू-स्पीच मॉडल में एकीकृत किया जा सकता है बिना रियल-टाइम कन्वर्सेशनल व्यवहार को त्यागे।