Pesquisadores apresentam o VideoX-Qwen, uma estrutura integrada que combina construção escalável de dados com treinamento de modelo para avançar na edição de vídeo de propósito geral e orientada por instruções. O sistema utiliza um pipeline de produção que organiza modelos especializados para gerar registros de edição direcional, resultando em mais de 1,2 milhão de amostras de alta qualidade nas tarefas de adição, remoção, substituição e atributos.
- O pipeline produz mais de 1,2 milhão de registros de edição de vídeo direcional com uma taxa de aceitação automática de 89%.
- Um editor unificado Qwen-Wan combina condicionamento semântico multimodal com orientação latente densa do vídeo fonte para transformações precisas.
- Em comparações com UniVideo e Kling O1, o VideoX-Qwen alcançou o melhor resultado médio em nove das onze métricas relatadas, incluindo seguimento de instruções e preservação de conteúdo.
Este trabalho fornece uma base prática para uma edição de vídeo mais capaz ao abordar a necessidade de supervisão pareada em larga escala e adaptação eficaz dos backbones de geração de vídeo.