字节跳动的Seed团队推出了SeedRealtime,这是一种原生的音视频全双工大语言模型,它将音频、视频和文本融合在一个统一的架构中。与传统的ASR、VLM和TTS模块级联堆栈不同,SeedRealtime并行运行感知、理解、决策和表达,以在连续的多模态流上实现实时交互。
- 该模型用内部的话轮转换机制取代了外部的语音活动检测器。
- 它展示了跨模态的身份绑定、基于持有指令的主动语音以及基于视觉状态的纠正。
- 人类评估报告指出,与级联堆栈相比,节奏问题减少了一半。
- SeedRealtime目前已在字节跳动的豆包App中上线,但缺乏技术报告、开源权重或公共API端点。
此次发布为实时语音加摄像头产品提供了一个经过验证的参考架构,尽管缺乏即时的第三方集成选项,但它确立了全模态交互的新基准。