A equipe Qwen da Alibaba lançou o Qwen-Audio-3.1, uma pilha de áudio com cinco modelos que inclui o novo Qwen-Audio-3.1-Realtime-plus, um modelo de fala full-duplex projetado para agentes de voz capazes de raciocínio e uso de ferramentas. O lançamento também introduz reduções de preço de até 95% nos serviços de ASR.
- O Qwen-Audio-3.1-Realtime-plus suporta 262K tokens de contexto com chamada de funções, busca na web e saídas estruturadas por meio de uma API gerenciada no QwenCloud.
- O treinamento utiliza uma abordagem de três camadas: Think (M²-OPD), Act (ambientes executáveis com recompensas GRPO) e Speak/Coordinate.
- As melhorias nos benchmarks incluem o Audio MultiChallenge subindo de 47,12 para 52,21 e o FLEURS WER caindo de 9,01 para 3,98 em comparação à versão 3.0.
- O modelo reduz as taxas de preenchimento no Full-Duplex-Bench v3.0 de 0,7590 para 0,2960, embora a latência de parada de interrupção seja de 1,116 segundos contra 0,383 do GPT-Realtime-2.
- O preço é definido em US$ 6,4 por 1M de tokens de entrada de áudio e US$ 24 por 1M de tokens de saída para texto e áudio.
O sistema visa melhorar a confiabilidade dos agentes de voz treinando modelos para decidir quando falar, agir e coordenar respostas dentro do histórico da conversa.