विषय · Video generation
lab OpenAI News · 7 दिन पहले · 14 बार देखा गया

GPT-6 Astra के साथ invideo का रंग ग्रेडिंग 3 गुना बेहतर

invideo अपने एजेंटिक वीडियो संपादन क्षमताओं को बढ़ाने के लिए GPT-6 Astra का उपयोग करता है, जिससे रंग ग्रेडिंग की सफलता दरों में तीन गुना वृद्धि हुई और एक दिन में 50 कस्टम प्रभाव उत्पन्न किए गए।

lab OpenAI News · 9 दिन पहले · 22 बार देखा गया

Higgsfield AI ने एक दिन में नए वीडियो फीचर लॉन्च करने के लिए GPT-6 Astra का उपयोग किया

Higgsfield AI ने अपने आंतरिक विकास कार्यप्रवाह को तेज़ करने और अपनी वीडियो विज्ञापन निर्माण प्लेटफ़ॉर्म को बेहतर बनाने के लिए OpenAI के GPT-6 Astra मॉडल को एकीकृत किया है। कंपनी का कहना है कि मॉडल एक इंजीनियर को केवल एक दिन में नए अन्वेषण फीचर प्रदान करने में सक्षम बनाता है।

lab NVIDIA Research · 16 दिन पहले · 20 बार देखा गया

FastGen-PDD तेज़ वीडियो और छवि निर्माण के लिए समानांतर डिकोडिंग डिस्टिलेशन पेश करता है

शोधकर्ताओं ने पैरेलल डिकोडिंग डिस्टिलेशन (PDD) का परिचय दिया, जो एक सरलीकृत ट्रेजेक्ट्री-आधारित विधि है जो डिफ्यूजन और फ्लो मैचिंग मॉडल्स में इनफरेंस को तेज़ करने के लिए बनाई गई है। वर्तमान दृष्टिकोणों के विपरीत जो ऑप्टिमाइज़ करने में कठिन वैरिएशनल स्कोर डिस्टिलेशन और एडवर्शियल लॉसेस पर निर्भर करते हैं, PDD नेटवर्क मूल्यांकन के दौरान कई डीनोइजिंग चरणों की भविष्यवाणी करता है।

media TLDR AI · 26 दिन पहले ARC-AGI 3 · 62.7% · 63 बार देखा गया

Nvidia ने Hugging Face को खरीदा; OpenAI ने GPT-6 Astra जारी किया; Microsoft ने MAI-Transcribe-2 लॉन्च किया

सितंबर 2026 की शुरुआत में, Nvidia ने $12.93 बिलियन में Hugging Face के अधिग्रहण की पुष्टि की, जबकि OpenAI ने GPT-6 Astra जारी किया और Microsoft ने MAI-Transcribe-2 वॉयस रिकग्निशन मॉडल लॉन्च किया।

media MarkTechPost · 6 घंटे पहले

NVIDIA के शोधकर्ताओं ने Cosmos 3 वीडियो मॉडल में भौतिक तर्क को बेहतर बनाने के लिए Physis-Lang जारी किया

NVIDIA, MIT और ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं ने Physis-Lang पेश किया है, एक फ्रेमवर्क जो कैप्शन में स्व-विकासशील भौतिक भाषा को एकीकृत करके वीडियो वर्ल्ड मॉडल को बढ़ावा देता है। यह दृष्टिकोण भौतिक भाषा को डेटा चयन, मॉडल प्रशिक्षण और उत्पन्न वीडियों में भौतिक त्रुटियों को ठीक करने के लिए उपयोग की जाने वाली एक अनुकूलनीय निरूपण के रूप में मानता है।

media MarkTechPost · 3 दिन पहले · 11 बार देखा गया

Google Research ने सहसंबद्ध, मिनटों तक चलने वाले वीडियो निर्माण के लिए 4 एजेंटिक फ्रेमवर्क पेश किए

Google Research ने एक AI वीडियो सह-निदेशक का परिचय दिया है, जिसमें चार एजेंटिक फ्रेमवर्क शामिल हैं जो बहु-शॉट पाइपलाइन में आम पहचान विचलन और श्रृंखलाबद्ध त्रुटियों को दूर करके सहसंबद्ध, मिनटों तक चलने वाले वीडियो उत्पन्न करने के लिए डिज़ाइन किए गए हैं। सिस्टम Gemini और Veo के ऊपर एक मॉडल-अज्ञेय ऑर्केस्ट्रेशन परत के रूप में काम करता है, जिसमें आउटपुट के लिए SynthID वाटरमार्किंग का उपयोग किया जाता है।

media Latent Space · 6 दिन पहले · 11 बार देखा गया

Runway ने रियल-टाइम इंटरैक्टिव वर्ल्ड जनरेशन के लिए WorldPrompt पेश किया

Runway ने GWM Worlds 2 पेश किया है, जो एक शोध पूर्वावलोकन है और ऑटोरेग्रेसिव डिफ्यूजन मॉडल का उपयोग करके उच्च-फिडेलिटी वीडियो और ऑडियो जनरेशन को रियल-टाइम इंटरैक्टिव सिमुलेशन में बदलता है। इस रिलीज़ में WorldPrompt शामिल है, एक नया इनपुट फॉर्मेट जो उपयोगकर्ताओं को पर्यावरण के पहलुओं को स्थिर करके और टाइमस्टैम्प्ड इवेंट्स बनाकर जनरेटेड वर्ल्ड्स और एक्शन निर्दिष्ट करने की अनुमति देता है।

arxiv arXiv cs.AI · 8 दिन पहले · 17 बार देखा गया

VideoX-Qwen निर्देश-आधारित वीडियो संपादन के लिए डेटा-केंद्रित ढांचा पेश करता है

शोधकर्ताओं ने VideoX-Qwen प्रस्तुत किया, एक एकीकृत ढांचा जो स्केलेबल डेटा निर्माण को मॉडल प्रशिक्षण के साथ जोड़ता है ताकि सामान्य-उद्देश्य, निर्देश-चालित वीडियो संपादन को आगे बढ़ाया जा सके। सिस्टम एक उत्पादन पाइपलाइन का उपयोग करता है जो विशेष मॉडलों को दिशात्मक संपादन रिकॉर्ड उत्पन्न करने के लिए संगठित करता है, जिससे जोड़ने, हटाने, प्रतिस्थापित करने और गुण कार्यों में 1.2 मिलियन से अधिक उच्च-गुणवत्ता वाले नमूने प्राप्त होते हैं।

media Hugging Face Forums · 17 दिन पहले · 26 बार देखा गया

Qualcomm QNN के माध्यम से Android पर स्थानीय बोलने वाले अवतार सक्षम बनाता है NanoAvatar

NanoAvatar एक ओपन-सोर्स प्रोजेक्ट है जो पुराने Android फोन पर क्लाउड GPU की आवश्यकता के बिना स्थानीय रूप से यथार्थवादी बोलने वाले अवतार चलाता है। रिलीज़ में सार्वजनिक कोड, मॉडल वेट्स और Android APKs शामिल हैं जो उपयोगकर्ता की अपनी आवाज़ के साथ ऑफ़लाइन उपयोग के लिए मॉडल और एक अवतार को बंडल करते हैं।

arxiv arXiv cs.LG · 20 दिन पहले · 34 बार देखा गया

Vidu S2 ने रियल-टाइम इंटरैक्टिव अवतार और एडिटिंग मॉडल पेश किए

Vidu S2 में Vidu S2-Avatar, एक रियल-टाइम इंटरैक्टिव डिजिटल-कैरेक्टर मॉडल, और Vidu S2-Editing, एक रियल-टाइम वीडियो एडिटिंग मॉडल शामिल हैं। सिस्टम दोनों घटकों के लिए रियल-टाइम स्पेशियल वीडियो जनरेशन की संभावना का भी अन्वेषण करता है।

media r/LocalLLaMA · 20 दिन पहले · 23 बार देखा गया

DeepSeek V4.1 Flash रिलीज वीडियो में बेहतर गतिशील वीडियो जनरेशन दिखाता है

एक उपयोगकर्ता ने नई रिलीज़ की गई DeepSeek V4.1 Flash मॉडल का उपयोग करके बनाया गया वीडियो प्रकाशित किया है ताकि गतिशील वीडियो संश्लेषण में इसकी क्षमताओं का परीक्षण किया जा सके।

media Hugging Face Forums · 23 दिन पहले · 27 बार देखा गया

उपयोगकर्ता वीडियो निर्माण के लिए Seedance 2.5 और AIide API का परीक्षण कर रहा है

एक उपयोगकर्ता ने AI द्वारा उत्पन्न वीडियो बनाने के लिए Seedance 2.5 के साथ प्रयोग किया है, जिसमें Seedance और अन्य मॉडलों तक पहुंच प्रदान करने वाले AIide API प्लेटफ़ॉर्म का उपयोग किया गया है।

media Hugging Face Forums · 25 दिन पहले · 28 बार देखा गया

Seedance 2.5 के पात्र की स्थिरता का कई फैशन लुक में परीक्षण

एक उपयोगकर्ता ने Seedance 2.5 वीडियो जनरेशन मॉडल का परीक्षण एक छोटी फैशन और editorial अनुक्रम का उपयोग करके किया, जिसमें विभिन्न परिधानों, संरचनाओं और दृश्य शैलियों में एक ही पात्र था।