El equipo Qwen de Alibaba presenta la serie Qwen2-VL, una actualización de los modelos visuales y lingüísticos anteriores que reemplaza el procesamiento de resolución fija con un mecanismo de Resolución Dinámica Ingenua. Esto permite al modelo ajustar dinámicamente los tokens visuales según la resolución de entrada, mejorando la captura de detalles y alineándose con los procesos perceptivos humanos.

  • La serie incluye modelos de peso abierto con 2B, 8B y 72B parámetros.
  • La integración del Embedido de Posición Rotacional Multimodal (M-RoPE) fusiona la información posicional entre texto, imágenes y videos.
  • Qwen2-VL-72B alcanza un rendimiento comparable al de GPT-4o y Claude 3.5 Sonnet en benchmarks multimodales.
  • La arquitectura soporta la comprensión de video de larga duración y la comprensión de texto e imagen multilingüe.

Los modelos tienen como objetivo proporcionar representaciones visuales eficientes para tareas de razonamiento complejo, manteniendo un rendimiento competitivo en varias escalas.