A equipe Qwen da Alibaba lançou o Qwen-Image-2.1, um modelo unificado de geração de imagem a partir de texto e edição de imagens que consolida os checkpoints anteriores separados em um único transformer de difusão com 7B de parâmetros.
- O modelo utiliza um DiT de 7B com atenção causal por blocos e um codificador Qwen3-VL de 8B para processar texto e condicionar imagens.
- Suporta transparência RGBA nativa, edição com múltiplas referências de até 10 imagens e edições em regiões locais preservando a identidade.
- Um mecanismo de atenção de granularidade mista permite o reuso do cache KV de prefixo, calculando as entradas de texto e referência apenas uma vez por etapa de geração.
- No Qwen-Image-Bench interno da Qwen, o modelo obtém 60.28 pontos, superando modelos de peso aberto listados como FLUX 2 Max (55.33), mas ficando atrás de modelos fechados como GPT Image 2.5 Sunburst (67.01).
- O lançamento inclui suporte desde o dia zero para Diffusers, ComfyUI, vLLM-Omni e SGLang, sendo necessária uma licença separada para uso comercial.
A arquitetura unificada visa fornecer uma solução econômica para tarefas de geração e edição, mantendo alta qualidade estética e suporte à transparência.