Tim Qwen dari Alibaba telah merilis Qwen-Audio-3.1, tumpukan audio lima model yang mencakup Qwen-Audio-3.1-Realtime-plus baru, sebuah model ucapan full-duplex yang dirancang untuk agen suara yang mampu melakukan penalaran dan penggunaan alat. Rilis ini juga memperkenalkan pengurangan harga hingga 95% pada layanan ASR.
- Qwen-Audio-3.1-Realtime-plus mendukung 262K token konteks dengan pemanggilan fungsi, pencarian web, dan output terstruktur melalui API terkelola di QwenCloud.
- Pelatihan menggunakan pendekatan tiga lapis: Berpikir (M²-OPD), Bertindak (lingkungan eksekusi dengan imbalan GRPO), dan Bicara/Koordinasi.
- Peningkatan benchmark mencakup Audio MultiChallenge yang naik dari 47,12 menjadi 52,21 dan FLEURS WER turun dari 9,01 menjadi 3,98 dibandingkan versi 3.0.
- Model ini mengurangi tingkat pengisi pada Full-Duplex-Bench v3.0 dari 0,7590 menjadi 0,2960, meskipun latensi henti interupsi adalah 1,116 detik versus 0,383 untuk GPT-Realtime-2.
- Harga ditetapkan sebesar $6,4 per 1M token input audio dan $24 per 1M token output untuk teks dan audio.
Sistem ini bertujuan meningkatkan keandalan agen suara dengan melatih model untuk memutuskan kapan harus berbicara, bertindak, dan mengoordinasikan respons dalam riwayat percakapan.