A equipe Qwen da Alibaba apresenta a série Qwen2-VL, uma atualização dos modelos visuais e linguísticos anteriores que substitui o processamento de resolução fixa por um mecanismo de Resolução Dinâmica Ingênua. Isso permite que o modelo ajuste dinamicamente os tokens visuais com base na resolução de entrada, melhorando a captura de detalhes e alinhando-se aos processos perceptivos humanos.
- A série inclui modelos de peso aberto com 2B, 8B e 72B parâmetros.
- A integração do Embedding Posicional Rotacional Multimodal (M-RoPE) funde informações posicionais entre texto, imagens e vídeos.
- Qwen2-VL-72B alcança desempenho comparável ao GPT-4o e Claude 3.5 Sonnet em benchmarks multimodais.
- A arquitetura suporta compreensão de vídeo de longa duração e compreensão multilíngue de texto e imagem.
Os modelos visam fornecer representações visuais eficientes para tarefas de raciocínio complexo, mantendo desempenho competitivo em várias escalas.