L'équipe Qwen d'Alibaba présente la série Qwen2-VL, une mise à jour des modèles visuels et linguistiques précédents qui remplace le traitement à résolution fixe par un mécanisme de Résolution Dynamique Naïve. Cela permet au modèle d'ajuster dynamiquement les tokens visuels en fonction de la résolution d'entrée, améliorant la capture des détails et s'alignant sur les processus perceptifs humains.

  • La série comprend des modèles à poids ouvert avec 2B, 8B et 72B paramètres.
  • L'intégration de l'Embedding de Position Rotatoire Multimodal (M-RoPE) fusionne les informations positionnelles entre le texte, les images et les vidéos.
  • Qwen2-VL-72B atteint des performances comparables à celles de GPT-4o et Claude 3.5 Sonnet sur les benchmarks multimodaux.
  • L'architecture prend en charge la compréhension vidéo longue durée et la compréhension multilingue de texte et d'image.

Les modèles visent à fournir des représentations visuelles efficaces pour des tâches de raisonnement complexe, tout en maintenant des performances compétitives à différentes échelles.