Команда Qwen от Alibaba выпустила Qwen-Image-2.1, унифицированную модель генерации изображений по тексту и их редактирования, которая объединяет предыдущие отдельные чекпоинты в единый диффузионный трансформер на 7B параметров.

  • Модель использует DiT на 7B с блочно-каузальным вниманием и кодировщик Qwen3-VL на 8B для обработки текста и условных изображений.
  • Она поддерживает нативную прозрачность RGBA, многократное редактирование по нескольким референсам (до 10 изображений) и локальные изменения с сохранением идентичности.
  • Механизм внимания смешанной гранулярности позволяет повторно использовать KV-кэш префикса, вычисляя текстовые и референсные входные данные только один раз на каждый шаг генерации.
  • На внутреннем бенчмарке Qwen-Image-Bench модель набирает 60.28, превосходя указанные модели с открытыми весами, такие как FLUX 2 Max (55.33), но уступая закрытым моделям, таким как GPT Image 2.5 Sunburst (67.01).
  • Выпуск включает поддержку с первого дня для Diffusers, ComfyUI, vLLM-Omni и SGLang; коммерческое использование требует отдельной лицензии.

Унифицированная архитектура призвана обеспечить экономически эффективное решение как для задач генерации, так и редактирования, сохраняя высокое эстетическое качество и поддержку прозрачности.