أطلقت فريق Qwen التابع لشركة أليبا الإصدار Qwen3.8-Omni-Flash، وهو أول نموذج متعدد الوسائط مصمم حول القدرات الذاتية للاستخدام في فهم الصوت والفيديو واستخدام الأدوات. يقبل النموذج مدخلات نصية وصورًا وصوتًا وفيديو لإرجاع مخرجات نصية، ويتميز بنافذة سياق تتسع لـ 1 مليون رمز ودعم استدعاء الوظائف بشكل أصلي.

  • مبني على بنية Qwen3.8-Flash-Next، يوفر سياقًا يتسع لـ 1 مليون رمز مع حد أقصى للمدخلات يبلغ 991 ألف رمز وحد أقصى للمخرجات يبلغ 131 ألف رمز.
  • يعتمد سير عمل إدراك ذاتي للفيديوهات الطويلة، مما رفع دقة OmniVideoBench من 63.4 إلى 67.8 مع تقليل استهلاك الرموز بنسبة 45.7%.
  • يُظهر النموذج مكاسب أداء كبيرة مقارنة بـ Qwen3.5-Omni-Plus، حيث تحسنت الدرجات المتوسطة بأكثر من 25% عبر 29 تقييمًا.
  • متاح عبر واجهة برمجة التطبيقات (API) على QwenCloud وAlibaba Cloud Model Studio وQwen Studio، بسعر 0.15 دولار لكل مليون رمز مدخل و0.47 دولار لكل مليون رمز مخرج.
  • قام الفريق أيضًا بنشر مكتبة Qwen-MM-Plugins تحت رخصة Apache-2.0 لدعم أطر عمل الوكلاء متعددي الوسائط.

يوفر هذا الإصدار حلاً مُستضافًا لسير العمل الذاتي المعقد الذي يتضمن تحليل الصوت والفيديو طويل المدى، مع انخفاض في التكاليف يبلغ أكثر من 93% للمدخلات السمعية والبصرية مقارنة بالنماذج السابقة.