NVIDIA는 실시간 풀듀플렉스 대화를 위해 설계된 오픈 11B 파라미터 엔드투엔드 음성-음성 모델인 NemotronLabs VoiceChat 11B를 출시했습니다. ASR, LLM 및 TTS를 체이닝하는 캐스케이디드 스택과 달리, 이 통합 네트워크는 스트리밍 음성을 동시에 이해하고 생성하며, Full-Duplex-Bench 1.0에서 측정된 부드러운 턴테이킹 지연시간은 448ms입니다.
- 아키텍처는 Fast Conformer 인코더, Nemotron Nano v2 LLM 백본 및 NVIDIA TTS 디코더를 결합했으며, 약 550k 시간의 오디오로 학습되었습니다.
- <TOOLCALL> 스크립트를 위한 별도 출력 채널을 통해 라이브 도구 호출을 지원하며, API 호출 중 공백음을 방지하기 위해 운영자가 "대기" 메시지를 정의할 수 있습니다.
- 모델은 턴 중간에 개입(barge in)할 수 있으며, 480ms에서 1.00의 전환율을 보이고 VoiceBench에서 오픈 풀듀플렉스 모델 중 2위를 차지합니다.
- 가중치는 관대한 OpenMDW-1.1 라이선스 하에 제공되지만, NVIDIA는 컨텍스트 상한 제한과 같은 알려진 실패 모드로 인해 체크포인트를 연구 목적으로만 사용 가능하다고 명시합니다.
- 배포에는 A100 또는 H100과 같이 최소 80 GB의 VRAM이 있는 단일 GPU가 필요하며, 현재 호스팅 API는 제공되지 않습니다.
이번 출시는 콜센터, 자동차 어시스턴트 및 접근성 도구용 파일럿을 위한 배포 가능한 옵션을 제공하지만, 아직 프로덕션 사용에는 권장되지 않습니다.