NemotronLabs 推出了 VoiceChat,这是一款开源权重的全双工语音到语音模型,旨在通过统一的流式架构整合监听、转录、推理和说话功能。该系统将流式语音编码器与仅解码器的语言模型相结合,并为智能体文本和结构化函数调用提供并行专用输出流,同时辅以用于增量用户转录的 RNN-T 分支。
- 在 Full-Duplex-Bench 1.0 上,该模型在已评估的开源系统中实现了最低的停顿处理接管率,在用户中断后实现 100% 的接管,且中断后的响应质量得分为 4.33/5。
- 在 Full-Duplex-Bench 1.5 上,它在 93% 的情况下能够在用户反馈后恢复响应。
- 该模型在 VoiceBench 上获得 55.1 的归一化平均分,并在 Full-Duplex-Bench 3.0 上实现 82.5% 的工具选择 F1 分数,尽管参数准确性和端到端工具执行仍需改进。
这些结果表明,全双工交互、语音识别与生成、通用语言能力以及外部工具使用可以在单个开源模型中整合,而不会牺牲实时对话行为。