NVIDIA发布了Nemotron 3 Diarization,这是一个开源权重的说话人日志模型,在Hugging Face上以OpenMDW License 1.1许可证提供。该100M参数模型使用单个检查点,在实时或离线模式下追踪多达8名重叠说话人。

  • 将NVIDIA之前Streaming Sortformer支持的4名说话人限制翻倍。
  • 在Voice Arena的初始Diarization-Bench上以14.72% DER排名第一,比次优系统相对降低24%。
  • 提供四个延迟操作点,从离线处理的30.4秒到超低延迟流媒体的0.32秒。
  • 使用约10,000小时真实对话和82,611小时模拟多说话人混合数据训练。
  • 通过NeMo在NVIDIA GPU上运行,支持包括.wav、.flac、.opus和.mp3在内的格式。

该模型使会议工具、通话分析和语音代理记忆系统能够在复杂音频环境中将语音归因于特定说话人。