A Equipe Qwen do Alibaba Group publicou um relatório técnico detalhando o Qwen2.5-VL, o mais recente modelo principal de sua série de visão e linguagem. O relatório descreve avanços significativos em reconhecimento visual, localização de objetos, análise de documentos e compreensão de vídeos longos.
- O modelo introduz processamento de resolução dinâmica e codificação de tempo absoluto para lidar com imagens de tamanhos variados e vídeos de até horas, com localização de eventos em nível de segundos.
- Um Vision Transformer (ViT) nativo de resolução dinâmica com Janela de Atenção reduz a sobrecarga computacional enquanto mantém a resolução nativa.
- O corpus de pré-treinamento foi ampliado de 1,2 trilhão de tokens para 4,1 trilhão de tokens, melhorando o desempenho em diversos domínios sem necessidade de ajuste fino específico para tarefas.
- O modelo principal Qwen2.5-VL-72B iguala modelos de ponta como GPT-4o e Claude 3.5 Sonnet, enquanto as variantes menores de 7B e 3B superam concorrentes em ambientes com recursos limitados.
O relatório enfatiza a capacidade do modelo de atuar como um agente visual interativo para raciocínio e execução de tarefas em computadores e dispositivos móveis.