Команда Qwen в составе Alibaba Group опубликовала технический отчёт, подробно описывающий Qwen2.5-VL — новейшую флагманскую модель в их серии моделей для работы с визуальными и языковыми данными. В отчёте освещены значительные достижения в области распознавания изображений, локализации объектов, разбора документов и понимания длинных видео.

  • Модель внедряет обработку динамического разрешения и абсолютное кодирование времени для работы с изображениями различных размеров и видео длительностью до нескольких часов с точной локализацией событий на уровне секунд.
  • Нативный динамический Vision Transformer (ViT) с оконным вниманием снижает вычислительные накладные расходы, сохраняя нативное разрешение.
  • Объём корпуса для предобучения увеличен с 1,2 триллиона токенов до 4,1 триллиона токенов, что улучшает показатели во многих областях без необходимости специфической донастройки под задачи.
  • Флагманская модель Qwen2.5-VL-72B сопоставима по возможностям с передовыми моделями, такими как GPT-4o и Claude 3.5 Sonnet, тогда как более компактные версии на 7B и 3B токенов превосходят конкурентов в условиях ограниченных ресурсов.

В отчёте подчёркивается способность модели выступать в роли интерактивного визуального агента для рассуждений и выполнения задач на компьютерах и мобильных устройствах.