نشر فريق Qwen التابع لمجموعة علي بابا تقريراً تقنياً يفصّل حول Qwen2.5-VL، أحدث نموذج رائد في سلسلة النماذج الخاصة بالرؤية واللغة. يسلط التقرير الضوء على تقدم كبير في التعرف البصري، وتحديد مواقع الأجسام، وتحليل المستندات، وفهم الفيديوهات الطويلة.

  • يقدم النموذج معالجة دقة متغيرة وترميزاً زمنياً مطلقاً للتعامل مع صور بأحجام مختلفة وفيديوهات تصل إلى ساعات طويلة مع تحديد أحداث بدقة ثانية.
  • يستخدم محول رؤية (ViT) أصلي ذو دقة متغيرة مع انتباه النوافذ لتقليل الحمل الحسابي مع الحفاظ على الدقة الأصلية.
  • تم توسيع مجموعة بيانات التدريب المسبق من 1.2 تريليون رمز إلى 4.1 تريليون رمز، مما يعزز الأداء عبر المجالات دون الحاجة إلى ضبط دقيق خاص بالمهمة.
  • يتفوق النموذج الرائد Qwen2.5-VL-72B في الأداء على نماذج رائدة مثل GPT-4o وClaude 3.5 Sonnet، بينما تتفوق المتغيرات الأصغر حجماً (7B و3B) على المنافسين في البيئات محدودة الموارد.

يشدد التقرير على قدرة النموذج على العمل كوكيل بصري تفاعلي للاستدلال وتنفيذ المهام على أجهزة الكمبيوتر والأجهزة المحمولة.