L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1, un modèle unifié de génération d'images à partir de texte et d'édition d'images qui consolide les précédents points de contrôle séparés en un seul transformateur de diffusion de 7B paramètres.
- Le modèle utilise un DiT de 7B avec une attention causale par blocs et un encodeur Qwen3-VL de 8B pour traiter le texte et conditionner les images.
- Il prend en charge la transparence RGBA native, l'édition multi-référence avec jusqu'à 10 images, et les éditions de régions locales tout en préservant l'identité.
- Un mécanisme d'attention à granularité mixte permet la réutilisation du cache KV de préfixe, calculant les entrées textuelles et de référence une seule fois par étape de génération.
- Sur le benchmark interne Qwen-Image-Bench de Qwen, le modèle obtient un score de 60,28, surpassant les modèles ouverts listés comme FLUX 2 Max (55,33) mais restant derrière les modèles fermés comme GPT Image 2.5 Sunburst (67,01).
- La publication inclut le support Day 0 pour Diffusers, ComfyUI, vLLM-Omni et SGLang, l'utilisation commerciale nécessitant une licence séparée.
L'architecture unifiée vise à fournir une solution rentable pour les tâches de génération et d'édition tout en maintenant une haute qualité esthétique et le support de la transparence.