Исследователи представляют VideoX-Qwen, интегрированную структуру, сочетающую масштабируемое конструирование данных с обучением модели для продвижения общего назначения, управляемого инструкциями, редактирования видео. Система использует производственный конвейер, который организует специализированные модели для генерации записей направленного редактирования, что приводит к более чем 1,2 миллиона высококачественных образцов по задачам добавления, удаления, замены и атрибутов.

  • Конвейер производит более 1,2 миллиона записей направленного редактирования видео с автоматическим коэффициентом принятия 89%.
  • Единый редактор Qwen-Wan объединяет мультимодальное семантическое условие с плотным латентным руководством исходного видео для точных преобразований.
  • В сравнениях с UniVideo и Kling O1, VideoX-Qwen достиг наилучшего среднего результата по девяти из одиннадцати сообщенных метрик, включая следование инструкциям и сохранение контента.

Эта работа предоставляет практическую основу для более способного редактирования видео, решая потребность в крупномасштабной парной супервизии и эффективной адаптации бэкбонов генерации видео.