El equipo de Qwen de Alibaba ha lanzado Qwen-Image-2.1, un modelo unificado de generación de texto a imagen y edición de imágenes que consolida los puntos de control anteriores separados en un único transformador de difusión de 7B parámetros.
- El modelo utiliza un DiT de 7B con atención causal por bloques y un codificador Qwen3-VL de 8B para procesar texto e imágenes de condición.
- Soporta transparencia RGBA nativa, edición con múltiples referencias de hasta 10 imágenes y ediciones de regiones locales preservando la identidad.
- Un mecanismo de atención de granularidad mixta permite la reutilización del caché KV de prefijo, calculando las entradas de texto y referencia solo una vez por paso de generación.
- En el benchmark interno Qwen-Image-Bench de Qwen, el modelo obtiene 60.28, superando a los modelos abiertos listados como FLUX 2 Max (55.33), pero quedándose atrás de los modelos cerrados como GPT Image 2.5 Sunburst (67.01).
- El lanzamiento incluye soporte desde el día 0 para Diffusers, ComfyUI, vLLM-Omni y SGLang, requiriendo una licencia separada para uso comercial.
La arquitectura unificada tiene como objetivo proporcionar una solución rentable tanto para tareas de generación como de edición, manteniendo una alta calidad estética y soporte de transparencia.