Video generation
arxiv arXiv cs.AI · 5 घंटे पहले · 10 बार देखा गया

VideoX-Qwen निर्देश-आधारित वीडियो संपादन के लिए डेटा-केंद्रित ढांचा पेश करता है

शोधकर्ताओं ने VideoX-Qwen प्रस्तुत किया, एक एकीकृत ढांचा जो स्केलेबल डेटा निर्माण को मॉडल प्रशिक्षण के साथ जोड़ता है ताकि सामान्य-उद्देश्य, निर्देश-चालित वीडियो संपादन को आगे बढ़ाया जा सके। सिस्टम एक उत्पादन पाइपलाइन का उपयोग करता है जो विशेष मॉडलों को दिशात्मक संपादन रिकॉर्ड उत्पन्न करने के लिए संगठित करता है, जिससे जोड़ने, हटाने, प्रतिस्थापित करने और गुण कार्यों में 1.2 मिलियन से अधिक उच्च-गुणवत्ता वाले नमूने प्राप्त होते हैं।

lab OpenAI News · 2 दिन पहले · 17 बार देखा गया

Higgsfield AI ने एक दिन में नए वीडियो फीचर लॉन्च करने के लिए GPT-6 Astra का उपयोग किया

Higgsfield AI ने अपने आंतरिक विकास कार्यप्रवाह को तेज़ करने और अपनी वीडियो विज्ञापन निर्माण प्लेटफ़ॉर्म को बेहतर बनाने के लिए OpenAI के GPT-6 Astra मॉडल को एकीकृत किया है। कंपनी का कहना है कि मॉडल एक इंजीनियर को केवल एक दिन में नए अन्वेषण फीचर प्रदान करने में सक्षम बनाता है।

lab NVIDIA Research · 8 दिन पहले · 15 बार देखा गया

FastGen-PDD तेज़ वीडियो और छवि निर्माण के लिए समानांतर डिकोडिंग डिस्टिलेशन पेश करता है

शोधकर्ताओं ने पैरेलल डिकोडिंग डिस्टिलेशन (PDD) का परिचय दिया, जो एक सरलीकृत ट्रेजेक्ट्री-आधारित विधि है जो डिफ्यूजन और फ्लो मैचिंग मॉडल्स में इनफरेंस को तेज़ करने के लिए बनाई गई है। वर्तमान दृष्टिकोणों के विपरीत जो ऑप्टिमाइज़ करने में कठिन वैरिएशनल स्कोर डिस्टिलेशन और एडवर्शियल लॉसेस पर निर्भर करते हैं, PDD नेटवर्क मूल्यांकन के दौरान कई डीनोइजिंग चरणों की भविष्यवाणी करता है।

media Hugging Face Forums · 10 दिन पहले · 20 बार देखा गया

Qualcomm QNN के माध्यम से Android पर स्थानीय बोलने वाले अवतार सक्षम बनाता है NanoAvatar

NanoAvatar एक ओपन-सोर्स प्रोजेक्ट है जो पुराने Android फोन पर क्लाउड GPU की आवश्यकता के बिना स्थानीय रूप से यथार्थवादी बोलने वाले अवतार चलाता है। रिलीज़ में सार्वजनिक कोड, मॉडल वेट्स और Android APKs शामिल हैं जो उपयोगकर्ता की अपनी आवाज़ के साथ ऑफ़लाइन उपयोग के लिए मॉडल और एक अवतार को बंडल करते हैं।

arxiv arXiv cs.LG · 12 दिन पहले · 29 बार देखा गया

Vidu S2 ने रियल-टाइम इंटरैक्टिव अवतार और एडिटिंग मॉडल पेश किए

Vidu S2 में Vidu S2-Avatar, एक रियल-टाइम इंटरैक्टिव डिजिटल-कैरेक्टर मॉडल, और Vidu S2-Editing, एक रियल-टाइम वीडियो एडिटिंग मॉडल शामिल हैं। सिस्टम दोनों घटकों के लिए रियल-टाइम स्पेशियल वीडियो जनरेशन की संभावना का भी अन्वेषण करता है।

media r/LocalLLaMA · 13 दिन पहले · 21 बार देखा गया

DeepSeek V4.1 Flash रिलीज वीडियो में बेहतर गतिशील वीडियो जनरेशन दिखाता है

एक उपयोगकर्ता ने नई रिलीज़ की गई DeepSeek V4.1 Flash मॉडल का उपयोग करके बनाया गया वीडियो प्रकाशित किया है ताकि गतिशील वीडियो संश्लेषण में इसकी क्षमताओं का परीक्षण किया जा सके।

media Hugging Face Forums · 16 दिन पहले · 26 बार देखा गया

उपयोगकर्ता वीडियो निर्माण के लिए Seedance 2.5 और AIide API का परीक्षण कर रहा है

एक उपयोगकर्ता ने AI द्वारा उत्पन्न वीडियो बनाने के लिए Seedance 2.5 के साथ प्रयोग किया है, जिसमें Seedance और अन्य मॉडलों तक पहुंच प्रदान करने वाले AIide API प्लेटफ़ॉर्म का उपयोग किया गया है।

media Hugging Face Forums · 18 दिन पहले · 25 बार देखा गया

Seedance 2.5 के पात्र की स्थिरता का कई फैशन लुक में परीक्षण

एक उपयोगकर्ता ने Seedance 2.5 वीडियो जनरेशन मॉडल का परीक्षण एक छोटी फैशन और editorial अनुक्रम का उपयोग करके किया, जिसमें विभिन्न परिधानों, संरचनाओं और दृश्य शैलियों में एक ही पात्र था।

media TLDR AI · 19 दिन पहले ARC-AGI 3 · 62.7% · 54 बार देखा गया

Nvidia ने Hugging Face को खरीदा; OpenAI ने GPT-6 Astra जारी किया; Microsoft ने MAI-Transcribe-2 लॉन्च किया

सितंबर 2026 की शुरुआत में, Nvidia ने $12.93 बिलियन में Hugging Face के अधिग्रहण की पुष्टि की, जबकि OpenAI ने GPT-6 Astra जारी किया और Microsoft ने MAI-Transcribe-2 वॉयस रिकग्निशन मॉडल लॉन्च किया।

media Hugging Face Forums · 23 दिन पहले · 32 बार देखा गया

फैशन-स्टाइल वीडियो स्थिरता के लिए Seedance 2.5 का परीक्षण

एक उपयोगकर्ता ने अनुक्रमों में दृश्य स्थिरता बनाए रखने की उसकी क्षमता का मूल्यांकन करने के लिए छोटे फैशन और संपादकीय-शैली वीडियो अवधारणाओं का उपयोग करके Seedance 2.5 मॉडल का परीक्षण किया।

media MarkTechPost · 25 दिन पहले · 51 बार देखा गया

गूगल ने 40-सेकंड के सीन एक्सटेंशन और 360p ड्राफ्ट्स के साथ Gemini Omni 1.1 Flash जारी किया

गूगल ने अपने मूल मल्टीमोडल वीडियो जनरेशन मॉडल के लिए एक उत्पादन अपडेट, Gemini Omni 1.1 Flash जारी किया है, जिसने सरल जनरेशन से सीधे एडिटेबल संपादन की ओर ध्यान केंद्रित किया है। इस अपडेट में Interactions API के माध्यम से स्टेटफुल इंटरैक्शन पेश किए गए हैं, जो उपयोगकर्ताओं को फ़ाइलों को फिर से अपलोड किए बिना पूर्व संदर्भ को बनाए रखते हुए वीडियो को संशोधित करने की अनुमति देते हैं।

media TLDR AI · 26 दिन पहले · 38 बार देखा गया

Gemini Omni 1.1 Flash में वीडियो नियंत्रण जोड़े गए; Codex स्थायी तर्क का समर्थन करता है

Google ने Gemini API के माध्यम से दृश्यों को विस्तारित करने, पहले और अंतिम फ्रेमों को इंटरपोलेट करने, 4K अपस्केलिंग और तेज़ वीडियो पुनरावृत्ति के लिए नए नियंत्रणों के साथ Gemini Omni 1.1 Flash पेश किया।

media Hugging Face Forums · 26 दिन पहले · 39 बार देखा गया

Seedance 2 का परीक्षण कैमरा गति और वातावरण में मजबूती को उजागर करता है

Seedance 2 AI वीडियो जनरेशन मॉडल का एक मूल्यांकन इसकी बेहतर समझ को रेखांकित करता है, जो कि सिनेमैटिक तत्वों की है और यह पिछले संस्करणों की तुलना में बेहतर है। परीक्षण दिखाता है कि जबकि मॉडल दृश्य निरंतरता और प्रकाशन को अच्छी तरह से संभालता है, यह जटिल वस्तुओं की सुसंगतता और प्रॉम्प्ट ओवरलोड के साथ अभी भी संघर्ष कर रहा है।

media Latent Space · 26 दिन पहले · 56 बार देखा गया

OpenAI का लक्ष्य 2026 के अंत तक AGI; माइक्रडक रॉबोट लॉन्च

OpenAI के चीफ साइंटिस्ट जाकुब पाचोकी ने बताया कि अनाउंस किए गए Astra मॉडल का उद्देश्य सितंबर 2026 तक एक "Automated AI Research Intern" बनना है, जबकि CEO सेम आल्टमैन का अनुमान है कि कंपनी AGI को अंदरूनी तौर पर दिसंबर 2026 तक हासिल करने की घोषणा करेगी।

lab Google DeepMind Blog · 27 दिन पहले · 63 बार देखा गया

गूगल ने सीन एक्सटेंशन और वीडियो कंट्रोल्स के साथ गेमिनी ओमनी 1.1 फ्लैश जारी किया

गूगल ने गेमिनी ओमनी 1.1 फ्लैश पेश किया है, जो रचनात्मक नियंत्रणों और जनरेटिव वीडियो क्षमताओं का एक नया सेट है, जिसे गूगल AI स्टूडियो में गेमिनी API के माध्यम से पेशेवर उपयोग के लिए उत्पादन-तैयार बनाने के लिए डिज़ाइन किया गया है।