शोधकर्ताओं ने VideoX-Qwen प्रस्तुत किया, एक एकीकृत ढांचा जो स्केलेबल डेटा निर्माण को मॉडल प्रशिक्षण के साथ जोड़ता है ताकि सामान्य-उद्देश्य, निर्देश-चालित वीडियो संपादन को आगे बढ़ाया जा सके। सिस्टम एक उत्पादन पाइपलाइन का उपयोग करता है जो विशेष मॉडलों को दिशात्मक संपादन रिकॉर्ड उत्पन्न करने के लिए संगठित करता है, जिससे जोड़ने, हटाने, प्रतिस्थापित करने और गुण कार्यों में 1.2 मिलियन से अधिक उच्च-गुणवत्ता वाले नमूने प्राप्त होते हैं।

  • पाइपलाइन 89% स्वतः स्वीकृति दर के साथ 1.2 मिलियन से अधिक दिशात्मक वीडियो-संपादन रिकॉर्ड उत्पन्न करती है।
  • एक एकीकृत Qwen-Wan संपादक बहुआयामी अर्थवैज्ञानिक शर्त को स्रोत-वीडियो लीनियर मार्गदर्शन के साथ जोड़ता है ताकि सटीक रूपांतरण किए जा सकें।
  • UniVideo और Kling O1 के साथ तुलना में, VideoX-Qwen ने निर्देश अनुसरण और सामग्री संरक्षण सहित 11 में से 9 मापदंडों पर सर्वश्रेष्ठ औसत परिणाम प्राप्त किया।

यह कार्य बड़े पैमाने पर युग्मित पर्यवेक्षण और वीडियो-जनरेटिंग बैकबोन के प्रभावी अनुकूलन की आवश्यकता को संबोधित करके अधिक सक्षम वीडियो संपादन के लिए एक व्यावहारिक आधार प्रदान करता है।