A Alibaba Cloud apresentou o Qwen3.8-Omni-Flash, um modelo agêntico multimodal nativo projetado para tarefas de produtividade do mundo real que melhora substancialmente a compreensão e o raciocínio multimodal em comparação com os modelos omni anteriores.

O modelo herda a arquitetura de mistura esparsa de especialistas (sparse mixture-of-experts) do Qwen3.8-Next e estende a janela de contexto para um milhão de tokens para suportar raciocínio multimodal de longo contexto e planejamento de longo prazo. Ele utiliza uma estratégia nativa de treinamento conjunto multimodal que preserva fortes capacidades no domínio de texto, ao mesmo tempo em que facilita a transferência de capacidades agênticas para tarefas de áudio e vídeo.

Para apoiar o deploy, a equipe lança o Qwen-MM-Plugins para produtividade multimodal e o Qwen-Live-Harness para construir agentes multimodais responsivos e em tempo real. Essas ferramentas permitem a integração em fluxos de trabalho de produção para aplicações como edição de vídeo, tradução de textos longos e geração condicionada por música.