Les chercheurs présentent VideoX-Qwen, un cadre intégré combinant la construction évolutive de données avec l'entraînement du modèle pour faire progresser l'édition vidéo générale et pilotée par des instructions. Le système utilise un pipeline de production qui organise des modèles spécialisés pour générer des enregistrements d'édition directionnelle, résultant en plus de 1,2 million d'échantillons de haute qualité dans les tâches d'ajout, de suppression, de remplacement et d'attributs.

  • Le pipeline produit plus de 1,2 million d'enregistrements d'édition vidéo directionnelle avec un taux d'acceptation automatique de 89%.
  • Un éditeur unifié Qwen-Wan combine la condition sémantique multimodale avec une guidance latente dense de la vidéo source pour des transformations précises.
  • Dans les comparaisons avec UniVideo et Kling O1, VideoX-Qwen a obtenu le meilleur résultat moyen sur neuf des onze métriques rapportées, y compris le suivi des instructions et la préservation du contenu.

Ce travail fournit une base pratique pour une édition vidéo plus capable en répondant au besoin de supervision appariée à grande échelle et d'adaptation efficace des backbones de génération vidéo.