アリババのQwenチームは、新しいQwen-Audio-3.1-Realtime-plusを含む5つのモデルからなるオーディオスタックであるQwen-Audio-3.1をリリースしました。これは、推論やツール使用が可能な音声エージェント向けに設計された全二重音声モデルです。また、本リリースではASRサービスの料金が最大95%引き下げられました。
- Qwen-Audio-3.1-Realtime-plusは、QwenCloud上の管理APIを通じて、262Kのコンテキストトークン、関数呼び出し、ウェブ検索、構造化出力をサポートします。
- トレーニングはThink (M²-OPD)、Act (GRPO報酬付き実行可能環境)、Speak/Coordinateという3層のアプローチを活用しています。
- ベンチマークの改善では、Audio MultiChallengeが47.12から52.21に上昇し、FLEURS WERがバージョン3.0と比較して9.01から3.98に低下しました。
- モデルはFull-Duplex-Bench v3.0におけるフィラー率を0.7590から0.2960に削減しましたが、中断停止レイテンシはGPT-Realtime-2の0.383秒に対して1.116秒です。
- 料金は、オーディオ入力トークン1Mあたり$6.4、テキストおよびオーディオ出力トークン1Mあたり$24に設定されています。
このシステムは、会話履歴内でいつ話すか、行動するか、応答を調整するかをモデルが判断できるようにトレーニングすることで、音声エージェントの信頼性を向上させることを目指しています。