أطلقت فريق كوين التابع لألبابا نموذج كوين-إيميج 2.1، وهو نموذج موحد لتوليد الصور من النص وتحريرها، يدمج نقاط التفتيش المنفصلة السابقة في محوّل انتشار واحد بـ 7 مليار معلمة.

  • يستخدم النموذج DiT بـ 7 مليار معلمة مع انتباه سببي كتلي ومُشفّر Qwen3-VL بـ 8 مليار معلمة لمعالجة النص وتكييف الصور.
  • يدعم الشفافية RGBA الأصلية، والتحرير متعدد المراجع باستخدام ما يصل إلى 10 صور، وتعديلات المناطق المحلية مع الحفاظ على الهوية.
  • تتيح آلية الانتباه متعددة الدقة إعادة استخدام ذاكرة التخزين المؤقت KV للبادئة، وحساب مدخلات النص والمراجع مرة واحدة فقط لكل خطوة توليد.
  • على منصة Qwen-Image-Bench الداخلية من كوين، حقق النموذج درجة 60.28، متفوقاً على النماذج مفتوحة الوزن المدرجة مثل FLUX 2 Max (55.33) لكنه متأخر عن النماغل المغلقة مثل GPT Image 2.5 Sunburst (67.01).
  • يتضمن الإصدار دعم اليوم الأول لمكتبات Diffusers وComfyUI وvLLM-Omni وSGLang، ويتطلب الاستخدام التجاري ترخيصاً منفصلاً.

يهدف الهيكل الموحد إلى تقديم حل فعال من حيث التكلفة لكل من مهام التوليد والتحرير مع الحفاظ على جودة جمالية عالية ودعم الشفافية.