Tim Qwen dari Alibaba telah merilis Qwen-Image-2.1, sebuah model terpadu untuk generasi teks-ke-gambar dan pengeditan gambar yang menggabungkan checkpoint terpisah sebelumnya menjadi satu transformer difusi 7B parameter.

  • Model ini menggunakan DiT 7B dengan perhatian kausal blok dan encoder Qwen3-VL 8B untuk memproses teks dan mengondisikan gambar.
  • Model ini mendukung transparansi RGBA asli, pengeditan multi-referensi hingga 10 gambar, serta pengeditan wilayah lokal sambil mempertahankan identitas.
  • Mekanisme perhatian granularitas campuran memungkinkan penggunaan ulang cache KV prefix, menghitung input teks dan referensi hanya sekali per langkah generasi.
  • Pada Qwen-Image-Bench buatan internal Qwen, model ini mencetak skor 60.28, melampaui model bobot terbuka yang terdaftar seperti FLUX 2 Max (55.33) tetapi tertinggal dari model tertutup seperti GPT Image 2.5 Sunburst (67.01).
  • Rilis ini mencakup dukungan Hari 0 untuk Diffusers, ComfyUI, vLLM-Omni, dan SGLang, dengan penggunaan komersial memerlukan lisensi terpisah.

Arsitektur terpadu bertujuan menyediakan solusi hemat biaya untuk tugas generasi dan pengeditan sambil mempertahankan kualitas estetika tinggi dan dukungan transparansi.