NVIDIA는 Hugging Face에서 OpenMDW License 1.1 하에 공개된 오픈 가중치 화자 분할 모델인 Nemotron 3 Diarization을 출시했습니다. 이 1억 파라미터 모델은 단일 체크포인트를 사용하여 실시간 또는 오프라인 모드에서 최대 8명의 중첩 화자를 추적합니다.
- NVIDIA의 기존 Streaming Sortformer가 지원하던 4명에서 화자 한계를 두 배로 늘렸습니다.
- Voice Arena의 초기 Diarization-Bench에서 DER 14.72%를 기록하며 1위를 차지했으며, 이는 다음으로 순위가 높은 시스템 대비 24% 상대적 감소를 의미합니다.
- 오프라인 처리에는 30.4초, 초저지연 스트리밍에는 0.32초에 이르기까지 4가지 지연 시간 운영 지점을 제공합니다.
- 약 10,000시간의 실제 대화와 82,611시간의 시뮬레이션 다중 화자 혼합 데이터로 학습되었습니다.
- NeMo를 통해 NVIDIA GPU에서 실행되며 .wav, .flac, .opus, .mp3 형식을 지원합니다.
이 모델은 복잡한 오디오 환경에서 회의 도구, 통화 분석 및 음성 에이전트 메모리 시스템이 음성을 특정 화자에게 귀속할 수 있도록 합니다.