Los investigadores presentan VideoX-Qwen, un marco integrado que combina la construcción escalable de datos con el entrenamiento del modelo para avanzar en la edición de video general e impulsada por instrucciones. El sistema utiliza una canalización de producción que organiza modelos especializados para generar registros de edición direccional, resultando en más de 1.2 millones de muestras de alta calidad en tareas de adición, eliminación, reemplazo y atributos.

  • La canalización produce más de 1.2 millones de registros de edición de video direccional con una tasa de aceptación automática del 89%.
  • Un editor unificado Qwen-Wan combina la condición semántica multimodal con la guía latente densa del video fuente para transformaciones precisas.
  • En comparaciones con UniVideo y Kling O1, VideoX-Qwen logró el mejor resultado medio en nueve de las once métricas reportadas, incluyendo seguimiento de instrucciones y preservación del contenido.

Este trabajo proporciona una base práctica para una edición de video más capaz al abordar la necesidad de supervisión emparejada a gran escala y la adaptación efectiva de los backbones de generación de video.