연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.

  • 파이프라인은 89%의 자동 승인률로 120만 개 이상의 방향성 비디오 편집 레코드를 생성합니다.
  • 통합된 Qwen-Wan 에디터는 다중 모달 의미 조건과 밀집된 소스 비디오 잠재 가이드를 결합하여 정밀한 변환을 수행합니다.
  • UniVideo 및 Kling O1과의 비교에서 VideoX-Qwen은 지시 따르기 및 콘텐츠 보존을 포함한 보고된 11개 지표 중 9개에서 가장 좋은 평균 결과를 달성했습니다.

이 작업은 대규모 쌍감독과 비디오 생성 백본의 효과적인 적응의 필요성을 해결하여 더 강력한 비디오 편집을 위한 실용적인 기반을 제공합니다.