Команда Qwen от Alibaba выпустила Qwen-Image-2.1, унифицированную модель генерации изображений по тексту и их редактирования, которая объединяет предыдущие отдельные чекпоинты в единый диффузионный трансформер на 7B параметров.
- Модель использует DiT на 7B с блочно-каузальным вниманием и кодировщик Qwen3-VL на 8B для обработки текста и условных изображений.
- Она поддерживает нативную прозрачность RGBA, многократное редактирование по нескольким референсам (до 10 изображений) и локальные изменения с сохранением идентичности.
- Механизм внимания смешанной гранулярности позволяет повторно использовать KV-кэш префикса, вычисляя текстовые и референсные входные данные только один раз на каждый шаг генерации.
- На внутреннем бенчмарке Qwen-Image-Bench модель набирает 60.28, превосходя указанные модели с открытыми весами, такие как FLUX 2 Max (55.33), но уступая закрытым моделям, таким как GPT Image 2.5 Sunburst (67.01).
- Выпуск включает поддержку с первого дня для Diffusers, ComfyUI, vLLM-Omni и SGLang; коммерческое использование требует отдельной лицензии.
Унифицированная архитектура призвана обеспечить экономически эффективное решение как для задач генерации, так и редактирования, сохраняя высокое эстетическое качество и поддержку прозрачности.