NVIDIA 发布了 Nemotron 3 Diarization,这是一款用于实时说话人分离的开源权重、100M 参数模型,支持多达八位说话人。该模型在 VoiceArena 的 Diarization-Bench 排行榜上排名第一,说话人错误率(DER)为 14.72%,比排名第二的系统相对降低了约 24%。
- 支持多达八个说话人通道,并使用到达时间排序处理重叠语音,以提供稳定的说话人标签。
- 在 VoiceArena 的基准测试中取得了 14.72% 的 DER,而第二名系统的 DER 为 19.3%。
- 使用公共数据和 David AI 授权的多说话人对话数据进行训练,使复合 DER 绝对值降低了 0.77 个百分点。
- 提供可配置的流式延迟,推荐的输入缓冲区延迟分别为 30.4、1.04、0.64 和 0.32 秒。
- 与 NVIDIA 之前的四说话人 Streaming Sortformer 基线相比,在八个公共基准测试中平均实现了 41.0% 的相对 DER 降低。
该模型通过将说话人分离时间戳与自动语音识别相结合,使应用程序能够创建带有说话人归属的转录文本,从而提升对话分析和语音代理记忆的实用性。