알리바바의 Qwen 팀은 이전의 별도 체크포인트를 단일 7B 파라미터 디퓨전 트랜스포머로 통합한 텍스트-이미지 생성 및 이미지 편집용 통합 모델인 Qwen-Image-2.1을 출시했습니다.

  • 이 모델은 텍스트와 조건 이미지를 처리하기 위해 블록 인과적 어텐션과 8B Qwen3-VL 인코더를 사용하는 7B DiT를 활용합니다.
  • 네이티브 RGBA 투명도, 최대 10장의 이미지를 사용한 다중 참조 편집, 그리고 정체성을 보존하는 지역 영역 편집을 지원합니다.
  • 혼합 세분성 어텐션 메커니즘은 접두사 KV 캐시 재사용을 가능하게 하여, 생성 단계마다 텍스트 및 참조 입력을 한 번만 계산합니다.
  • Qwen의 자체 벤치마크인 Qwen-Image-Bench에서 이 모델은 60.28점을 획득하여 FLUX 2 Max(55.33)와 같은 공개 가중치 모델을 능가하지만, GPT Image 2.5 Sunburst(67.01)와 같은 폐쇄형 모델에는 미치지 못합니다.
  • 이번 출시에는 Diffusers, ComfyUI, vLLM-Omni, SGLang에 대한 Day 0 지원이 포함되며, 상업적 사용은 별도 라이선스가 필요합니다.

통합 아키텍처는 높은 미적 품질과 투명도 지원을 유지하면서 생성 및 편집 작업 모두에 대해 비용 효율적인 솔루션을 제공하는 것을 목표로 합니다.