L'équipe Qwen d'Alibaba a publié Qwen-Audio-3.1, une pile audio composée de cinq modèles incluant le nouveau Qwen-Audio-3.1-Realtime-plus, un modèle de parole plein duplex conçu pour les agents vocaux capables de raisonnement et d'utilisation d'outils. La publication introduit également des réductions de prix allant jusqu'à 95 % sur les services ASR.

  • Qwen-Audio-3.1-Realtime-plus prend en charge 262K tokens de contexte avec appel de fonctions, recherche web et sorties structurées via une API gérée sur QwenCloud.
  • L'entraînement utilise une approche à trois niveaux : Penser (M²-OPD), Agir (environnements exécutables avec récompenses GRPO) et Parler/Coordonner.
  • Les améliorations des benchmarks incluent l'élévation de Audio MultiChallenge de 47,12 à 52,21 et la baisse de FLEURS WER de 9,01 à 3,98 par rapport à la version 3.0.
  • Le modèle réduit les taux de remplissage sur Full-Duplex-Bench v3.0 de 0,7590 à 0,2960, bien que la latence d'arrêt d'interruption soit de 1,116 seconde contre 0,383 pour GPT-Realtime-2.
  • Le prix est fixé à 6,4 $ par 1M de tokens d'entrée audio et 24 $ par 1M de tokens de sortie pour le texte et l'audio.

Le système vise à améliorer la fiabilité des agents vocaux en entraînant les modèles à décider quand parler, agir et coordonner les réponses dans l'historique de conversation.