NemotronLabs 推出了 NemotronLabs VoiceChat,这是一款开源权重的全双工语音到语音模型,在统一的流式架构中集成了原生工具调用能力。该系统将流式语音编码器与仅解码器的语言模型相结合,提供用于智能体文本和结构化函数调用的并行输出流,同时配备辅助的 RNN-T 分支用于增量转录以及流式 TTS 解码器。

  • 在 Full-Duplex-Bench 1.0 上评估的开源权重系统中,实现了最低的停顿处理接管率,用户中断后接管率为 100%,中断后的响应质量得分为 4.33/5。
  • 在 Full-Duplex-Bench 1.5 上,93% 的情况下能在用户反馈后恢复响应。
  • 在 VoiceBench 上获得 55.1 的归一化平均分,在 Full-Duplex-Bench 3.0 上工具选择 F1 得分为 82.5%,尽管参数准确性和端到端工具执行仍需改进。

该模型证明,全双工交互、语音识别与生成、通用语言能力以及外部工具使用可以整合在一个单一的开源语音到语音模型中,而不会牺牲实时对话行为。