NemotronLabs는 듣기, 전사, 추론, 발화를 통합된 스트리밍 아키텍처 내에서 결합하도록 설계된 오픈 가중치 풀듀플렉스 음성-음성 모델인 VoiceChat을 출시했습니다. 이 시스템은 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합하여 에이전트 텍스트 및 구조화된 함수 호출을 위한 병렬 특수화 출력 스트림과 증분 사용자 전사를 위한 보조 RNN-T 브랜치를 제공합니다.
- Full-Duplex-Bench 1.0에서 이 모델은 평가된 오픈 가중치 시스템 중 가장 낮은 일시 정지 처리 전환율을 기록했으며, 사용자 방해 후 100% 전환과 방해 후 응답 품질 점수 4.33/5를 달성했습니다.
- Full-Duplex-Bench 1.5에서 사용자 백채널 후 응답을 재개하는 비율은 93%입니다.
- VoiceBench에서 정규화 평균 55.1점을 획득했으며, Full-Duplex-Bench 3.0에서 도구 선택 F1 점수 82.5%를 달성했지만, 인자 정확도와 엔드투엔드 도구 실행은 개선이 필요합니다.
이러한 결과는 풀듀플렉스 상호작용, 음성 인식 및 생성, 일반 언어 능력, 외부 도구 사용이 실시간 대화 동작을 희생하지 않고 단일 오픈 모델에서 통합될 수 있음을 보여줍니다.