تقدم فريق Qwen التابع لأليبابا سلسلة Qwen2-VL، وهي ترقية للنماذج السابقة للرؤية واللغة تستبدل معالجة الدقة الثابتة بآلية Naive Dynamic Resolution. يتيح ذلك للنموذج ضبط الرموز البصرية ديناميكيًا بناءً على دقة الإدخال، مما يحسن التقاط التفاصيل ويتماشى مع عمليات الإدراك البشري.

  • تشمل السلسلة نماذج بأوزان مفتوحة تحتوي على 2B و8B و72B معلمة.
  • يدمج تكامل التضمين الموضعي الدوار متعدد الوسائط (M-RoPE) المعلومات الموضعية عبر النص والصور ومقاطع الفيديو.
  • يحقق Qwen2-VL-72B أداءً يقابل GPT-4o وClaude 3.5 Sonnet في الاختبارات المرجعية متعددة الوسائط.
  • يدعم الهيكل فهم الفيديو طويل المدى والفهم متعدد اللغات للنص والصورة.

تهدف النماذج إلى توفير تمثيلات بصرية فعالة لمهام الاستدلال المعقدة مع الحفاظ على أداء تنافسي عبر مقاييس مختلفة.