Команда Qwen от Alibaba выпустила Qwen3.8-Omni-Flash, свою первую омнимодель, разработанную вокруг агентных возможностей для понимания аудио-видео и использования инструментов. Модель принимает текстовые, изображенные, аудиовходные и видео данные для возврата текстовых выходов, обладая контекстным окном в 1M токенов и нативным вызовом функций.

  • Построенная на архитектуре Qwen3.8-Flash-Next, она предлагает контекст в 1M токенов с максимум 991K входных и 131K выходных токенов.
  • Она использует агентный рабочий процесс восприятия для длинных видео, повышая точность OmniVideoBench с 63.4 до 67.8 при этом сокращая использование токенов на 45.7%.
  • Модель демонстрирует значительные улучшения производительности по сравнению с Qwen3.5-Omni-Plus, со средними баллами улучшающимися более чем на 25% в 29 оценках.
  • Она доступна через API на QwenCloud, Alibaba Cloud Model Studio и Qwen Studio, с ценой $0.15 за 1M входных токенов и $0.47 за 1M выходных токенов.
  • Команда также открыла исходный код Qwen-MM-Plugins под лицензией Apache-2.0 для поддержки омнимодальных агентных хабов.

Выпуск предоставляет размещенное решение для сложных агентных рабочих процессов, включающих анализ длинных аудио и видео, с сообщаемым снижением затрат более чем на 93% для аудио-визуальных входов по сравнению с предыдущими моделями.