Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.
Модель наследует архитектуру разреженного смешения экспертов (sparse mixture-of-experts) от Qwen3.8-Next и расширяет окно контекста до одного миллиона токенов для поддержки мультимодального рассуждения с длинным контекстом и планирования на длительных горизонтах. Она использует стратегию нативного совместного обучения мультимодальных данных, которая сохраняет сильные способности в текстовой области, одновременно способствуя передаче агентных возможностей задачам аудио и видео.
Для поддержки развертывания команда выпустила Qwen-MM-Plugins для мультимодальной продуктивности и Qwen-Live-Harness для создания отзывчивых, работающих в реальном времени мультимодальных агентов. Эти инструменты позволяют интегрировать модель в производственные рабочие процессы для таких приложений, как видеомонтаж, перевод длинных текстов и генерация под музыку.