NVIDIAは、Hugging FaceでOpenMDWライセンス1.1の下で公開されているオープンウェイトの話者 diarization モデル「Nemotron 3 Diarization」をリリースしました。この1億パラメータのモデルは、単一のチェックポイントを使用して、リアルタイムまたはオフラインモードで最大8人の重なり合う話者を追跡します。
- NVIDIAの以前のStreaming Sortformer(4人まで対応)と比較して、話者の上限を2倍に拡大。
- Voice Arenaの初期Diarization-Benchで14.72%のDER(誤認率)を達成し、次点のシステムに対して相対的に24%の削減を実現。
- オフライン処理では30.4秒、超低遅延ストリーミングでは0.32秒など、4つのレイテンシ動作ポイントを提供。
- 約1万時間の実際の会話と8万2,611時間のシミュレーションされたマルチ話者ミックスデータでトレーニング済み。
- NeMo経由でNVIDIA GPU上で実行可能であり、.wav、.flac、.opus、.mp3などの形式に対応。
このモデルは、会議ツール、通話分析、音声エージェントの記憶システムにおいて、複雑な音声環境の中で特定の発話者を識別することを可能にします。