Alibaba Cloud a présenté Qwen3.8-Omni-Flash, un modèle agentique multimodal natif conçu pour les tâches de productivité du monde réel qui améliore substantiellement la compréhension et le raisonnement multimodaux par rapport aux modèles omni précédents.
Le modèle hérite de l'architecture de mélange épars d'experts (sparse mixture-of-experts) de Qwen3.8-Next et étend la fenêtre de contexte à un million de tokens pour prendre en charge le raisonnement multimodal à long contexte et la planification à long terme. Il utilise une stratégie native d'entraînement conjoint multimodal qui préserve de fortes capacités dans le domaine du texte tout en facilitant le transfert des capacités agentiques vers les tâches audio et vidéo.
Pour soutenir le déploiement, l'équipe lance Qwen-MM-Plugins pour la productivité multimodale et Qwen-Live-Harness pour construire des agents multimodaux réactifs et en temps réel. Ces outils permettent l'intégration dans les flux de travail de production pour des applications telles que le montage vidéo, la traduction longue et la génération conditionnée par la musique.