Tim Qwen dari Alibaba telah merilis Qwen-Audio-3.1, tumpukan audio lima model yang mencakup Qwen-Audio-3.1-Realtime-plus baru, sebuah model ucapan full-duplex yang dirancang untuk agen suara yang mampu melakukan penalaran dan penggunaan alat. Rilis ini juga memperkenalkan pengurangan harga hingga 95% pada layanan ASR.

  • Qwen-Audio-3.1-Realtime-plus mendukung 262K token konteks dengan pemanggilan fungsi, pencarian web, dan output terstruktur melalui API terkelola di QwenCloud.
  • Pelatihan menggunakan pendekatan tiga lapis: Berpikir (M²-OPD), Bertindak (lingkungan eksekusi dengan imbalan GRPO), dan Bicara/Koordinasi.
  • Peningkatan benchmark mencakup Audio MultiChallenge yang naik dari 47,12 menjadi 52,21 dan FLEURS WER turun dari 9,01 menjadi 3,98 dibandingkan versi 3.0.
  • Model ini mengurangi tingkat pengisi pada Full-Duplex-Bench v3.0 dari 0,7590 menjadi 0,2960, meskipun latensi henti interupsi adalah 1,116 detik versus 0,383 untuk GPT-Realtime-2.
  • Harga ditetapkan sebesar $6,4 per 1M token input audio dan $24 per 1M token output untuk teks dan audio.

Sistem ini bertujuan meningkatkan keandalan agen suara dengan melatih model untuk memutuskan kapan harus berbicara, bertindak, dan mengoordinasikan respons dalam riwayat percakapan.