Лаборатория Tongyi компании Alibaba выпустила Qwen-Audio-3.0-TTS, облачную систему преобразования текста в речь, доступную в двух вариантах: Flash для взаимодействия в реальном времени и Plus для генерации высокого качества. Обе версии предоставляются через Alibaba Cloud Model Studio, а не в виде загружаемых весов.
- Модель поддерживает 16 языков и 20 диалектных регионов Китая, при этом Flash демонстрирует наименьший средний уровень ошибок слов/иероглифов — 3.87.
- Qwen-Audio-3.0-TTS-Plus занимает первое место в рейтинге Artificial Analysis Text-to-Speech с показателем Elo около 1236.
- Система включает 86 детализированных встроенных тегов для невербальных деталей, таких как смех и дыхание, а также управление стилем на естественном языке.
- Flash ориентирован на задержку первого пакета в 300 мс, тогда как Plus делает акцент на точности тембра и сходстве голоса, занимая лидирующие позиции по всем 16 языкам.
Выпуск предоставляет разработчикам мощные возможности многоязычного синтеза и детализированный контроль аудио через облачный API.