A equipe Qwen da Alibaba lançou o Qwen3.8-Omni-Flash, seu primeiro modelo omni-modal projetado em torno de capacidades agênticas para compreensão áudio-vídeo e uso de ferramentas. O modelo aceita entradas de texto, imagens, áudio e vídeo para retornar saídas de texto, apresentando uma janela de contexto de 1M de tokens e chamada nativa de funções.

  • Construído sobre a arquitetura Qwen3.8-Flash-Next, oferece um contexto de 1M de tokens com 991K de entrada máxima e 131K de saída máxima de tokens.
  • Emprega um fluxo de percepção agêntico para vídeos longos, elevando a precisão do OmniVideoBench de 63,4 para 67,8 enquanto reduz o uso de tokens em 45,7%.
  • O modelo mostra ganhos significativos de desempenho em relação ao Qwen3.5-Omni-Plus, com pontuações médias melhorando mais de 25% em 29 avaliações.
  • Está disponível via API no QwenCloud, Alibaba Cloud Model Studio e Qwen Studio, com preço de US$ 0,15 por 1M de tokens de entrada e US$ 0,47 por 1M de tokens de saída.
  • A equipe também disponibilizou como código aberto o Qwen-MM-Plugins sob a licença Apache-2.0 para suportar harnesses de agentes multimodais.

O lançamento fornece uma solução hospedada para fluxos de trabalho agênticos complexos envolvendo análise de áudio e vídeo em formato longo, com reduções de custo relatadas de mais de 93% para entradas áudio-visuais em comparação com modelos anteriores.