अलibaba की क्वेन टीम ने Qwen-Image-2.1 जारी किया है, जो एकत्रीकृत टेक्स्ट-टू-इमेज जनरेशन और इमेज संपादन मॉडल है जो पिछले अलग-अलग चेकपॉइंट्स को एकल 7B पैरामीटर डिफ्यूजन ट्रांसफॉर्मर में समेटता है।

  • इस मॉडल में ब्लॉक-कॉज़ियल एटेंशन के साथ 7B DiT और टेक्स्ट व शर्त छवियों को प्रोसेस करने के लिए 8B Qwen3-VL एन्कोडर का उपयोग होता है।
  • यह नेटिव RGBA पारदर्शिता, 10 छवियों तक बहु-संदर्भ संपादन और पहचान बनाए रखते हुए स्थानीय क्षेत्र संपादन का समर्थन करता है।
  • मिश्रित-ग्रेन्युलरिटी एटेंशन तंत्र प्रीफ़िक्स KV कैश पुन: उपयोग की अनुमति देता है, जिससे टेक्स्ट और संदर्भ इनपुट को प्रत्येक जनरेशन चरण में केवल एक बार गणना किया जाता है।
  • क्वेन के आंतरिक Qwen-Image-Bench पर, मॉडल 60.28 अंक प्राप्त करता है, जो FLUX 2 Max (55.33) जैसे सूचीबद्ध ओपन-वेट मॉडल्स को पछाड़ता है लेकिन GPT Image 2.5 Sunburst (67.01) जैसे बंद मॉडल्स से पीछे रहता है।
  • रिलीज में Diffusers, ComfyUI, vLLM-Omni और SGLang के लिए Day 0 समर्थन शामिल है, जिसमें व्यावसायिक उपयोग के लिए अलग से लाइसेंस की आवश्यकता होती है।

एकत्रीकृत आर्किटेक्चर जनरेशन और संपादन दोनों कार्यों के लिए एक लागत-प्रभावी समाधान प्रदान करने का लक्ष्य रखता है, जबकि उच्च सौंदर्य गुणवत्ता और पारदर्शिता समर्थन बनाए रखता है।