El equipo Qwen de Alibaba ha lanzado Qwen-Audio-3.1, una pila de audio de cinco modelos que incluye el nuevo Qwen-Audio-3.1-Realtime-plus, un modelo de voz full-dúplex diseñado para agentes de voz capaces de razonar y usar herramientas. El lanzamiento también introduce reducciones de precios de hasta el 95% en los servicios ASR.

  • Qwen-Audio-3.1-Realtime-plus admite 262K tokens de contexto con llamada a funciones, búsqueda web y salidas estructuradas a través de una API gestionada en QwenCloud.
  • El entrenamiento utiliza un enfoque de tres capas: Pensar (M²-OPD), Actuar (entornos ejecutables con recompensas GRPO) y Hablar/Coordinar.
  • Las mejoras en benchmarks incluyen que Audio MultiChallenge suba de 47.12 a 52.21 y que FLEURS WER baje de 9.01 a 3.98 en comparación con la versión 3.0.
  • El modelo reduce las tasas de muletillas en Full-Duplex-Bench v3.0 de 0.7590 a 0.2960, aunque la latencia de interrupción es de 1.116 segundos frente a 0.383 para GPT-Realtime-2.
  • El precio se fija en $6.4 por cada 1M tokens de entrada de audio y $24 por cada 1M tokens de salida para texto y audio.

El sistema tiene como objetivo mejorar la fiabilidad de los agentes de voz entrenando a los modelos para decidir cuándo hablar, actuar y coordinar respuestas dentro del historial de conversación.