NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款面向实时全双工对话的开源11B参数端到端语音转语音模型。与串联ASR、LLM和TTS的级联堆栈不同,该统一网络同时执行流式语音理解和生成,在Full-Duplex-Bench 1.0上测得的平滑切换延迟为448毫秒。

  • 架构结合了Fast Conformer编码器、Nemotron Nano v2 LLM主干以及NVIDIA TTS解码器,使用约550k小时音频进行训练。
  • 通过用于<TOOLCALL>脚本的独立输出通道支持实时工具调用,允许操作员定义“等待中”消息,以防止API调用期间的静音。
  • 模型允许用户在对话中途打断,在480毫秒时的接管率为1.00,并在VoiceBench上位列开源全双工模型第2名。
  • 权重在宽松的OpenMDW-1.1许可下提供,但NVIDIA将该检查点标记为仅限研究用途,因为存在已知故障模式,如上下文上限限制。
  • 部署需要至少80 GB显存的单个GPU(如A100或H100),目前未提供托管API。

该发布为呼叫中心、汽车辅助工具和辅助功能工具中的试点项目提供了可部署选项,但尚未推荐用于生产环境。