L'équipe Qwen d'Alibaba Group a publié un rapport technique détaillant Qwen2.5-VL, le dernier modèle phare de leur série vision-langage. Le rapport met en avant des avancées significatives dans la reconnaissance visuelle, la localisation d'objets, l'analyse de documents et la compréhension de vidéos longues.

  • Le modèle introduit le traitement de résolution dynamique et l'encodage temporel absolu pour gérer des images de tailles variées et des vidéos pouvant durer plusieurs heures avec une localisation d'événements au niveau de la seconde.
  • Un Vision Transformer (ViT) à résolution dynamique native avec Attention par fenêtre réduit la surcharge computationnelle tout en maintenant la résolution native.
  • Le corpus d'entraînement préliminaire a été étendu de 1,2 billion de tokens à 4,1 billions de tokens, améliorant les performances dans divers domaines sans nécessiter de réglage fin spécifique à une tâche.
  • Le modèle phare Qwen2.5-VL-72B égale les modèles de pointe tels que GPT-4o et Claude 3.5 Sonnet, tandis que les variantes plus petites 7B et 3B surpassent les concurrents dans des environnements aux ressources limitées.

Le rapport souligne la capacité du modèle à servir d'agent visuel interactif pour le raisonnement et l'exécution de tâches sur les ordinateurs et les appareils mobiles.