Команда Qwen от Alibaba выпустила Qwen-Audio-3.1, пятикомпонентный аудио стек, включающий новую модель Qwen-Audio-3.1-Realtime-plus, полнодуплексную речевую модель, предназначенную для голосовых агентов, способных к рассуждениям и использованию инструментов. В релизе также представлены скидки до 95% на услуги ASR.

  • Qwen-Audio-3.1-Realtime-plus поддерживает контекст из 262K токенов с вызовом функций, веб-поиском и структурированными выводами через управляемый API в QwenCloud.
  • Обучение использует трехуровневый подход: Think (M²-OPD), Act (исполняемые среды с наградами GRPO) и Speak/Coordinate.
  • Улучшения по бенчмаркам включают рост Audio MultiChallenge с 47.12 до 52.21 и снижение FLEURS WER с 9.01 до 3.98 по сравнению с версией 3.0.
  • Модель снижает частоту заполнителей на Full-Duplex-Bench v3.0 с 0.7590 до 0.2960, хотя задержка остановки прерывания составляет 1.116 секунды против 0.383 у GPT-Realtime-2.
  • Цены установлены на уровне $6.4 за 1M входных аудио токенов и $24 за 1M выходных токенов для текста и аудио.

Система направлена на повышение надежности голосовых агентов путем обучения моделей решать, когда говорить, действовать и координировать ответы в рамках истории разговора.