L'équipe Qwen d'Alibaba a publié Qwen3.8-Omni-Flash, son premier modèle omni-modal conçu autour de capacités agentic pour la compréhension audio-vidéo et l'utilisation d'outils. Le modèle accepte des entrées textuelles, images, audio et vidéo pour retourner des sorties textuelles, avec une fenêtre de contexte de 1M tokens et un appel de fonction natif.

  • Basé sur l'architecture Qwen3.8-Flash-Next, il offre un contexte de 1M tokens avec 991K tokens d'entrée max et 131K tokens de sortie max.
  • Il utilise un flux de perception agentic pour les longues vidéos, augmentant la précision OmniVideoBench de 63,4 à 67,8 tout en réduisant l'utilisation de tokens de 45,7 %.
  • Le modèle montre des gains de performance significatifs par rapport à Qwen3.5-Omni-Plus, avec des scores moyens améliorés de plus de 25 % sur 29 évaluations.
  • Il est disponible via API sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio, avec une tarification à 0,15 $ par 1M tokens d'entrée et 0,47 $ par 1M tokens de sortie.
  • L'équipe a également open-sourcé Qwen-MM-Plugins sous Apache-2.0 pour soutenir les harnesses agentic multimodaux.

La publication fournit une solution hébergée pour des flux de travail agentic complexes impliquant l'analyse audio et vidéo longue forme, avec des réductions de coûts signalées de plus de 93 % pour les entrées audiovisuelles par rapport aux modèles précédents.