अलibaba की Qwen टीम ने Qwen3.8-Omni-Flash जारी किया है, जो ऑडियो-वीडियो समझ और टूल उपयोग के लिए एजेंटिक क्षमताओं के आसपास डिज़ाइन किया गया उनका पहला ओमनी-मोडल मॉडल है। मॉडल टेक्स्ट, छवियों, ऑडियो और वीडियो इनपुट स्वीकार करता है ताकि टेक्स्ट आउटपुट वापस ला सके, जिसमें 1M-टोकन संदर्भ विंडो और नेटिव फंक्शन कॉलिंग शामिल हैं।

  • Qwen3.8-Flash-Next आर्किटेक्चर पर बनाया गया, इसमें 991K अधिकतम इनपुट और 131K अधिकतम आउटपुट टोकन के साथ 1M-टोकन संदर्भ प्रदान करता है।
  • यह लंबे वीडियो के लिए एजेंटिक परसेप्शन वर्कफ़्लो का उपयोग करता है, जिससे OmniVideoBench सटीकता 63.4 से बढ़कर 67.8 हो जाती है जबकि टोकन उपयोग 45.7% कम हो जाता है।
  • मॉडल Qwen3.5-Omni-Plus की तुलना में महत्वपूर्ण प्रदर्शन लाभ दिखाता है, जहाँ 29 मूल्यांकनों में औसत स्कोर 25% से अधिक बेहतर हुए हैं।
  • यह QwenCloud, अलibaba क्लाउड मॉडल स्टूडियो और Qwen Studio के माध्यम से API पर उपलब्ध है, जिसकी कीमत $0.15 प्रति 1M इनपुट टोकन और $0.47 प्रति 1M आउटपुट टोकन है।
  • टीम ने बहुआयामी एजेंट हार्नेस का समर्थन करने के लिए Apache-2.0 के तहत Qwen-MM-Plugins को ओपन-सोर्स भी किया है।

रिलीज़ लंबे ऑडियो और वीडियो विश्लेषण वाले जटिल एजेंटिक वर्कफ़्लो के लिए एक होस्टेड समाधान प्रदान करती है, जिसमें पिछले मॉडलों की तुलना में ऑडियो-विजुअल इनपुट के लिए लागत में 93% से अधिक की कमी की रिपोर्ट है।