GPT-6 Astra के साथ invideo का रंग ग्रेडिंग 3 गुना बेहतर
invideo अपने एजेंटिक वीडियो संपादन क्षमताओं को बढ़ाने के लिए GPT-6 Astra का उपयोग करता है, जिससे रंग ग्रेडिंग की सफलता दरों में तीन गुना वृद्धि हुई और एक दिन में 50 कस्टम प्रभाव उत्पन्न किए गए।
invideo अपने एजेंटिक वीडियो संपादन क्षमताओं को बढ़ाने के लिए GPT-6 Astra का उपयोग करता है, जिससे रंग ग्रेडिंग की सफलता दरों में तीन गुना वृद्धि हुई और एक दिन में 50 कस्टम प्रभाव उत्पन्न किए गए।
Higgsfield AI ने अपने आंतरिक विकास कार्यप्रवाह को तेज़ करने और अपनी वीडियो विज्ञापन निर्माण प्लेटफ़ॉर्म को बेहतर बनाने के लिए OpenAI के GPT-6 Astra मॉडल को एकीकृत किया है। कंपनी का कहना है कि मॉडल एक इंजीनियर को केवल एक दिन में नए अन्वेषण फीचर प्रदान करने में सक्षम बनाता है।
शोधकर्ताओं ने पैरेलल डिकोडिंग डिस्टिलेशन (PDD) का परिचय दिया, जो एक सरलीकृत ट्रेजेक्ट्री-आधारित विधि है जो डिफ्यूजन और फ्लो मैचिंग मॉडल्स में इनफरेंस को तेज़ करने के लिए बनाई गई है। वर्तमान दृष्टिकोणों के विपरीत जो ऑप्टिमाइज़ करने में कठिन वैरिएशनल स्कोर डिस्टिलेशन और एडवर्शियल लॉसेस पर निर्भर करते हैं, PDD नेटवर्क मूल्यांकन के दौरान कई डीनोइजिंग चरणों की भविष्यवाणी करता है।
सितंबर 2026 की शुरुआत में, Nvidia ने $12.93 बिलियन में Hugging Face के अधिग्रहण की पुष्टि की, जबकि OpenAI ने GPT-6 Astra जारी किया और Microsoft ने MAI-Transcribe-2 वॉयस रिकग्निशन मॉडल लॉन्च किया।
NVIDIA, MIT और ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं ने Physis-Lang पेश किया है, एक फ्रेमवर्क जो कैप्शन में स्व-विकासशील भौतिक भाषा को एकीकृत करके वीडियो वर्ल्ड मॉडल को बढ़ावा देता है। यह दृष्टिकोण भौतिक भाषा को डेटा चयन, मॉडल प्रशिक्षण और उत्पन्न वीडियों में भौतिक त्रुटियों को ठीक करने के लिए उपयोग की जाने वाली एक अनुकूलनीय निरूपण के रूप में मानता है।
Google Research ने एक AI वीडियो सह-निदेशक का परिचय दिया है, जिसमें चार एजेंटिक फ्रेमवर्क शामिल हैं जो बहु-शॉट पाइपलाइन में आम पहचान विचलन और श्रृंखलाबद्ध त्रुटियों को दूर करके सहसंबद्ध, मिनटों तक चलने वाले वीडियो उत्पन्न करने के लिए डिज़ाइन किए गए हैं। सिस्टम Gemini और Veo के ऊपर एक मॉडल-अज्ञेय ऑर्केस्ट्रेशन परत के रूप में काम करता है, जिसमें आउटपुट के लिए SynthID वाटरमार्किंग का उपयोग किया जाता है।
Runway ने GWM Worlds 2 पेश किया है, जो एक शोध पूर्वावलोकन है और ऑटोरेग्रेसिव डिफ्यूजन मॉडल का उपयोग करके उच्च-फिडेलिटी वीडियो और ऑडियो जनरेशन को रियल-टाइम इंटरैक्टिव सिमुलेशन में बदलता है। इस रिलीज़ में WorldPrompt शामिल है, एक नया इनपुट फॉर्मेट जो उपयोगकर्ताओं को पर्यावरण के पहलुओं को स्थिर करके और टाइमस्टैम्प्ड इवेंट्स बनाकर जनरेटेड वर्ल्ड्स और एक्शन निर्दिष्ट करने की अनुमति देता है।
शोधकर्ताओं ने VideoX-Qwen प्रस्तुत किया, एक एकीकृत ढांचा जो स्केलेबल डेटा निर्माण को मॉडल प्रशिक्षण के साथ जोड़ता है ताकि सामान्य-उद्देश्य, निर्देश-चालित वीडियो संपादन को आगे बढ़ाया जा सके। सिस्टम एक उत्पादन पाइपलाइन का उपयोग करता है जो विशेष मॉडलों को दिशात्मक संपादन रिकॉर्ड उत्पन्न करने के लिए संगठित करता है, जिससे जोड़ने, हटाने, प्रतिस्थापित करने और गुण कार्यों में 1.2 मिलियन से अधिक उच्च-गुणवत्ता वाले नमूने प्राप्त होते हैं।
NanoAvatar एक ओपन-सोर्स प्रोजेक्ट है जो पुराने Android फोन पर क्लाउड GPU की आवश्यकता के बिना स्थानीय रूप से यथार्थवादी बोलने वाले अवतार चलाता है। रिलीज़ में सार्वजनिक कोड, मॉडल वेट्स और Android APKs शामिल हैं जो उपयोगकर्ता की अपनी आवाज़ के साथ ऑफ़लाइन उपयोग के लिए मॉडल और एक अवतार को बंडल करते हैं।
Vidu S2 में Vidu S2-Avatar, एक रियल-टाइम इंटरैक्टिव डिजिटल-कैरेक्टर मॉडल, और Vidu S2-Editing, एक रियल-टाइम वीडियो एडिटिंग मॉडल शामिल हैं। सिस्टम दोनों घटकों के लिए रियल-टाइम स्पेशियल वीडियो जनरेशन की संभावना का भी अन्वेषण करता है।
एक उपयोगकर्ता ने नई रिलीज़ की गई DeepSeek V4.1 Flash मॉडल का उपयोग करके बनाया गया वीडियो प्रकाशित किया है ताकि गतिशील वीडियो संश्लेषण में इसकी क्षमताओं का परीक्षण किया जा सके।
एक उपयोगकर्ता ने AI द्वारा उत्पन्न वीडियो बनाने के लिए Seedance 2.5 के साथ प्रयोग किया है, जिसमें Seedance और अन्य मॉडलों तक पहुंच प्रदान करने वाले AIide API प्लेटफ़ॉर्म का उपयोग किया गया है।
एक उपयोगकर्ता ने Seedance 2.5 वीडियो जनरेशन मॉडल का परीक्षण एक छोटी फैशन और editorial अनुक्रम का उपयोग करके किया, जिसमें विभिन्न परिधानों, संरचनाओं और दृश्य शैलियों में एक ही पात्र था।