Команда Qwen компании Alibaba представляет серию Qwen2-VL, обновление предыдущих моделей визуального и языкового понимания, которое заменяет обработку с фиксированным разрешением на механизм Naive Dynamic Resolution. Это позволяет модели динамически адаптировать визуальные токены в зависимости от входного разрешения, улучшая захват деталей и согласуясь с процессами человеческого восприятия.

  • Серия включает модели с открытым весом объемом 2B, 8B и 72B параметров.
  • Интеграция многомерного позиционного кодирования M-RoPE объединяет информацию о положении в тексте, изображениях и видео.
  • Qwen2-VL-72B демонстрирует производительность, сопоставимую с GPT-4o и Claude 3.5 Sonnet на мультимодальных бенчмарках.
  • Архитектура поддерживает понимание видео длительной продолжительности и многоязычное понимание текста по изображениям.

Модели призваны обеспечивать эффективные визуальные представления для сложных задач рассуждения, сохраняя конкурентоспособную производительность на различных масштабах.