阿里巴巴通义千问团队发布了Qwen-Audio-3.1,这是一个包含五个模型的音频堆栈,其中包括全新的Qwen-Audio-3.1-Realtime-plus,这是一款专为具备推理和工具使用能力的语音代理设计的全双工语音模型。此次发布还引入了ASR服务价格最高降低95%的优惠。
- Qwen-Audio-3.1-Realtime-plus支持262K上下文令牌,可通过QwenCloud上的托管API进行函数调用、网络搜索和结构化输出。
- 训练采用三层方法:思考(M²-OPD)、行动(具有GRPO奖励的可执行环境)以及说话/协调。
- 基准测试改进包括Audio MultiChallenge从47.12提升至52.21,FLEURS WER从9.01降至3.98,相较于3.0版本。
- 该模型将Full-Duplex-Bench v3.0上的填充率从0.7590降低至0.2960,尽管中断停止延迟为1.116秒,而GPT-Realtime-2为0.383秒。
- 定价为每1M音频输入令牌6.4美元,每1M文本和音频输出令牌24美元。
该系统旨在通过训练模型决定在对话历史中何时说话、行动和协调响应,来提高语音代理的可靠性。