El equipo de Qwen de Alibaba ha lanzado Qwen-Image-2.1, un modelo unificado de generación de texto a imagen y edición de imágenes que consolida los puntos de control anteriores separados en un único transformador de difusión de 7B parámetros.

  • El modelo utiliza un DiT de 7B con atención causal por bloques y un codificador Qwen3-VL de 8B para procesar texto e imágenes de condición.
  • Soporta transparencia RGBA nativa, edición con múltiples referencias de hasta 10 imágenes y ediciones de regiones locales preservando la identidad.
  • Un mecanismo de atención de granularidad mixta permite la reutilización del caché KV de prefijo, calculando las entradas de texto y referencia solo una vez por paso de generación.
  • En el benchmark interno Qwen-Image-Bench de Qwen, el modelo obtiene 60.28, superando a los modelos abiertos listados como FLUX 2 Max (55.33), pero quedándose atrás de los modelos cerrados como GPT Image 2.5 Sunburst (67.01).
  • El lanzamiento incluye soporte desde el día 0 para Diffusers, ComfyUI, vLLM-Omni y SGLang, requiriendo una licencia separada para uso comercial.

La arquitectura unificada tiene como objetivo proporcionar una solución rentable tanto para tareas de generación como de edición, manteniendo una alta calidad estética y soporte de transparencia.