NemotronLabs ने VoiceChat का परिचय दिया, जो एक खुले वजन वाला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है जिसे एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर सुनने, ट्रांसक्रिप्शन, तर्क और बोलने को एकीकृत करने के लिए डिज़ाइन किया गया है। सिस्टम में एक स्ट्रीमिंग स्पीच एन्कोडर और डिकोडर-केवल भाषा मॉडल का संयोजन शामिल है, जिसमें एजेंट टेक्स्ट और संरचित फ़ंक्शन कॉल्स के लिए समानांतर विशेष आउटपुट स्ट्रीम्स हैं, साथ ही एक सहायक RNN-T शाखा है जो क्रमिक उपयोगकर्ता ट्रांसक्रिप्शन के लिए है।

  • Full-Duplex-Bench 1.0 पर, मॉडल का रुकने की प्रक्रिया संभालने का लेखान दर मूल्यांकन किए गए खुले वजन वाले सिस्टमों में सबसे कम है, जिसमें उपयोगकर्ता के बाधा डालने के बाद 100% लेखान और बाधा के बाद की प्रतिक्रिया गुणवत्ता स्कोर 4.33/5 है।
  • यह Full-Duplex-Bench 1.5 पर उपयोगकर्ता के बैकचैनल के बाद 93% मामलों में प्रतिक्रियाओं को फिर से शुरू करता है।
  • मॉडल VoiceBench पर 55.1 सामान्यीकृत औसत प्राप्त करता है और Full-Duplex-Bench 3.0 पर 82.5% टूल-चयन F1 प्राप्त करता है, हालांकि तर्क सटीकता और अंत-से-अंत टूल निष्पादन में सुधार की आवश्यकता है।

ये परिणाम दर्शाते हैं कि पूर्ण-द्विदिशीय इंटरैक्शन, स्पीच रिकग्निशन और जनरेशन, सामान्य भाषा क्षमताएं और बाहरी टूल उपयोग को एकल खुले मॉडल में एकीकृत किया जा सकता है बिना वास्तविक समय की बातचीत व्यवहार को त्यागे।