阿里巴巴Qwen团队发布了Qwen-Image-2.1,这是一个统一的文本到图像生成和图像编辑模型,将之前独立的检查点整合为一个拥有70亿参数的扩散Transformer。

  • 该模型使用具有块因果注意力的7B DiT以及8B Qwen3-VL编码器来处理文本并条件化图像。
  • 它支持原生RGBA透明度、最多10张图像的多参考编辑,以及在保持身份不变的情况下进行局部区域编辑。
  • 混合粒度注意力机制允许前缀KV缓存复用,在每个生成步骤中仅计算一次文本和参考输入。
  • 在Qwen自研的Qwen-Image-Bench上,该模型得分60.28,优于列出的开源权重模型如FLUX 2 Max(55.33),但落后于闭源模型如GPT Image 2.5 Sunburst(67.01)。
  • 此次发布包括对Diffusers、ComfyUI、vLLM-Omni和SGLang的Day 0支持,商业用途需要单独的许可证。

统一的架构旨在为生成和编辑任务提供具有成本效益的解决方案,同时保持高美学质量和透明度支持。