Команда Qwen компании Alibaba представляет серию Qwen2-VL, обновление предыдущих моделей визуального и языкового понимания, которое заменяет обработку с фиксированным разрешением на механизм Naive Dynamic Resolution. Это позволяет модели динамически адаптировать визуальные токены в зависимости от входного разрешения, улучшая захват деталей и согласуясь с процессами человеческого восприятия.
- Серия включает модели с открытым весом объемом 2B, 8B и 72B параметров.
- Интеграция многомерного позиционного кодирования M-RoPE объединяет информацию о положении в тексте, изображениях и видео.
- Qwen2-VL-72B демонстрирует производительность, сопоставимую с GPT-4o и Claude 3.5 Sonnet на мультимодальных бенчмарках.
- Архитектура поддерживает понимание видео длительной продолжительности и многоязычное понимание текста по изображениям.
Модели призваны обеспечивать эффективные визуальные представления для сложных задач рассуждения, сохраняя конкурентоспособную производительность на различных масштабах.