El equipo de Qwen de Alibaba Group ha publicado un informe técnico que detalla Qwen2.5-VL, el último modelo insignia de su serie de visión-lenguaje. El informe describe avances significativos en reconocimiento visual, localización de objetos, análisis de documentos y comprensión de videos largos.
- El modelo introduce procesamiento de resolución dinámica y codificación de tiempo absoluto para manejar imágenes de tamaños variados y videos de hasta horas de duración con localización de eventos a nivel de segundo.
- Un Vision Transformer (ViT) nativo de resolución dinámica con Atención por Ventana reduce la sobrecarga computacional mientras mantiene la resolución nativa.
- El corpus de preentrenamiento se escaló de 1.2 billones de tokens a 4.1 billones de tokens, mejorando el rendimiento en diversos dominios sin ajuste fino específico para tareas.
- El modelo insignia Qwen2.5-VL-72B iguala a modelos de última generación como GPT-4o y Claude 3.5 Sonnet, mientras que las variantes más pequeñas de 7B y 3B superan a la competencia en entornos con recursos limitados.
El informe enfatiza la capacidad del modelo para actuar como un agente visual interactivo para razonamiento y ejecución de tareas en computadoras y dispositivos móviles.