L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1, un modèle unifié de génération d'images à partir de texte et d'édition d'images qui consolide les précédents points de contrôle séparés en un seul transformateur de diffusion de 7B paramètres.

  • Le modèle utilise un DiT de 7B avec une attention causale par blocs et un encodeur Qwen3-VL de 8B pour traiter le texte et conditionner les images.
  • Il prend en charge la transparence RGBA native, l'édition multi-référence avec jusqu'à 10 images, et les éditions de régions locales tout en préservant l'identité.
  • Un mécanisme d'attention à granularité mixte permet la réutilisation du cache KV de préfixe, calculant les entrées textuelles et de référence une seule fois par étape de génération.
  • Sur le benchmark interne Qwen-Image-Bench de Qwen, le modèle obtient un score de 60,28, surpassant les modèles ouverts listés comme FLUX 2 Max (55,33) mais restant derrière les modèles fermés comme GPT Image 2.5 Sunburst (67,01).
  • La publication inclut le support Day 0 pour Diffusers, ComfyUI, vLLM-Omni et SGLang, l'utilisation commerciale nécessitant une licence séparée.

L'architecture unifiée vise à fournir une solution rentable pour les tâches de génération et d'édition tout en maintenant une haute qualité esthétique et le support de la transparence.