Tim Qwen dari Alibaba memperkenalkan seri Qwen2-VL, peningkatan dari model visi-bahasa sebelumnya yang mengganti pemrosesan resolusi tetap dengan mekanisme Naive Dynamic Resolution. Ini memungkinkan model menyesuaikan token visual secara dinamis berdasarkan resolusi input, meningkatkan penangkapan detail dan selaras dengan proses persepsi manusia.

  • Seri ini mencakup model bobot terbuka dengan 2B, 8B, dan 72B parameter.
  • Integrasi Embedding Posisi Rotasi Multimodal (M-RoPE) menggabungkan informasi posisi di antara teks, gambar, dan video.
  • Qwen2-VL-72B mencapai kinerja yang sebanding dengan GPT-4o dan Claude 3.5 Sonnet pada benchmark multimodal.
  • Arsitektur mendukung pemahaman video durasi panjang dan pemahaman teks-gambar multibahasa.

Model-model ini bertujuan untuk menyediakan representasi visual yang efisien untuk tugas penalaran kompleks sambil mempertahankan kinerja kompetitif di berbagai skala.