A equipe Qwen da Alibaba apresenta a série Qwen2-VL, uma atualização dos modelos visuais e linguísticos anteriores que substitui o processamento de resolução fixa por um mecanismo de Resolução Dinâmica Ingênua. Isso permite que o modelo ajuste dinamicamente os tokens visuais com base na resolução de entrada, melhorando a captura de detalhes e alinhando-se aos processos perceptivos humanos.

  • A série inclui modelos de peso aberto com 2B, 8B e 72B parâmetros.
  • A integração do Embedding Posicional Rotacional Multimodal (M-RoPE) funde informações posicionais entre texto, imagens e vídeos.
  • Qwen2-VL-72B alcança desempenho comparável ao GPT-4o e Claude 3.5 Sonnet em benchmarks multimodais.
  • A arquitetura suporta compreensão de vídeo de longa duração e compreensão multilíngue de texto e imagem.

Os modelos visam fornecer representações visuais eficientes para tarefas de raciocínio complexo, mantendo desempenho competitivo em várias escalas.