विषय · Video generation
lab xAI News · 14 दिन पहले · 11 बार देखा गया

xAI ने Imagine Video 1.5 में छवि और आवाज़ संदर्भ जोड़े हैं

xAI ने अपने Imagine Video 1.5 मॉडल को अपडेट किया है ताकि यह पाठ, छवि और आवाज़ संदर्भों का समर्थन कर सके, जिससे उपयोगकर्ता 1080p रिज़ॉल्यूशन तक वीडियो जनरेट कर सकते हैं। इस अपडेट के साथ दृश्यों में चेहरे और आवाज़ को लॉक करके पात्रों की स्थिरता सुनिश्चित की जा सकती है, और प्रत्येक जनरेशन के लिए सात संदर्भों तक का समर्थन मिलता है।

lab Google — The Keyword (AI) · 29 दिन पहले · 7 बार देखा गया

Google ने Google Vids में Gemini Omni और व्यक्तिगत अवतार जोड़े

Google ने Google Vids के लिए दो नए अपडेट जारी किए: टेक्स्ट-आधारित वीडियो निर्माण और संपादन के लिए Gemini Omni का एकीकरण, और एक विशेषता जो उपयोगकर्ताओं को व्यक्तिगत डिजिटल अवतार बनाने की अनुमति देती है। ये उपकरण प्राकृतिक भाषा प्रॉम्प्ट्स और छवि संदर्भों से क्लिप्स उत्पन्न करने के साथ-साथ भौतिक रिकॉर्डिंग के बिना वीडियो में अभिनय करने की सुविधा देकर वीडियो निर्माण को सरल बनाने का लक्ष्य रखते हैं।

lab NVIDIA Research · 5 घंटे पहले · 1 बार देखा गया

HorizonRelight लंबी अवधि के वीडियो रिलाइटिंग के लिए मस्क्ड सेल्फ-कंडीशनिंग का उपयोग करता है

शोधकर्ताओं ने कार्य को समय-शर्तित लैटेंट डोमेन अनुवाद के रूप में फिर से परिभाषित करके लंबी अवधि के वीडियो रिलाइटिंग में कालिक असंततताओं को संबोधित किया। फ्रेमवर्क सीमाओं पर लक्ष्य-डोमेन लैटेंट को प्रसारित करके क्रॉस-चंक निरंतरता को लागू करता है और इस व्यवहार को सीखने योग्य बनाने के लिए मस्क्ड लक्ष्य-डोमेन सेल्फ-कंडीशनिंग का उपयोग करता है।

media MarkTechPost · 3 दिन पहले · 7 बार देखा गया

LTX ने स्थानीय वीडियो निर्माण के लिए खुले वजन वाले विश्व मॉडल LTX-2.5 को जारी किया

LTX ने वीडियो निर्माण, रियल-टाइम एप्लिकेशन और भौतिक AI के लिए एक खुले वजन वाले विश्व मॉडल LTX-2.5 को जारी किया है, जो NVIDIA RTX GPUs और DGX Spark हार्डवेयर पर स्थानीय इनफरेंस के लिए अनुकूलित है। यह रिलीज VRAM आवश्यकताओं को कम करके और प्रति-जनरेट शुल्क को समाप्त करके वीडियो उत्पादन को क्लाउड इंफ्रास्ट्रक्चर से स्थानीय डेस्कटॉप की ओर ले जाने का लक्ष्य रखती है।

media r/LocalLLaMA · 5 दिन पहले · 11 बार देखा गया

MiniMax ने समन्वित ऑडियो के साथ ओपन-वेइट H3 वीडियो मॉडल जारी किया

MiniMax ने MiniMax H3 जारी किया है, जो एक ओपन-वेइट मल्टीमोडल वीडियो जनरेशन मॉडल है जो टेक्स्ट, छवियों, वीडियो और ऑडियो को प्रोसेस करने में सक्षम है। मॉडल दृश्य और समन्वित स्टीरियो ऑडियो का संयुक्त उत्पादन करता है, जिसमें संवाद, ध्वनि प्रभाव, पृष्ठभूमि और संगीत शामिल हैं, न कि ऑडियो को एक पोस्ट-प्रोसेसिंग चरण के रूप में जोड़ना।

media r/LocalLLaMA · 5 दिन पहले · 9 बार देखा गया

MiniMax ने ओपन-वेट H3 वीडियो जनरेशन मॉडल को नेटिव स्टीरियो ऑडियो के साथ जारी किया

MiniMax ने Hugging Face पर ओपन-वेट H3 ओमनी-मोडल वीडियो जनरेशन मॉडल जारी किया, जिसमें नेटिव स्टीरियो ऑडियो है जो एक फॉरवर्ड पास में वीडियो को चला सकता है। मॉडल 5 से 15 सेकंड तक के क्लिप्स के लिए 2K रिज़ॉल्यूशन और 24fps का समर्थन करता है और प्रति जनरेशन नौ रेफरेंस इमेज, तीन वीडियो और तीन ऑडियो क्लिप स्वीकार करता है।

media AI News (smol.ai) · 10 दिन पहले · 2 बार देखा गया

Qwen, NVIDIA, Mistral और Black Forest Labs ने नए मॉडल जारी किए; राउटिंग और सुरक्षा पर ध्यान केंद्रित

यह 3-4 अगस्त 2026 के लिए AI समाचार समीक्षा Alibaba Qwen, NVIDIA, Mistral AI और Black Forest Labs से महत्वपूर्ण मॉडल रिलीज़, एजेंट राउटिंग, इंफ्रास्ट्रक्चर और साइबर सुरक्षा में विकास को कवर करती है।

media MarkTechPost · 14 दिन पहले · 17 बार देखा गया

मिनीमैक्स ने मिनीमैक्स एच3 जारी किया, एक ओम्नी-मोडल वीडियो मॉडल जो 2K क्लिप को नेटिव स्टीरियो ऑडियो के साथ जनरेट करता है

मिनीमैक्स ने मिनीमैक्स एच3 जारी किया, एक सामान्य-उद्देश्य बहु-मोडल जनरेशन मॉडल जो टेक्स्ट, इमेज, वीडियो और ऑडियो को एक ही संदर्भ में एकीकृत करता है ताकि नेटिव स्टीरियो ध्वनि के साथ 15 सेकंड तक लंबे 2K वीडियो क्लिप उत्पन्न किए जा सकें। पिछले स्टैक्स के विपरीत जो विशिष्ट कार्यों के लिए अलग-अलग विशेषज्ञ मॉडल पर निर्भर करते हैं, एच3 उपयोगकर्ताओं को प्राकृतिक भाषा प्रॉम्प्ट्स के माध्यम से संदर्भ और संपादन संबंधों को व्यक्त करने की अनुमति देता है।

media r/LocalLLaMA · 15 दिन पहले · 9 बार देखा गया

MiniMax जल्द ही ओपन वेट्स के साथ MiniMax H3 वीडियो मॉडल जारी करेगा

MiniMax ने MiniMax H3 लॉन्च किया है, जो एक सामान्य-उद्देश्य बहुआयामी जनरेटिव मॉडल है जो टेक्स्ट, छवियों, वीडियो और ऑडियो के बीच एकीकृत संदर्भ को समझता है। यह मॉडल 15 सेकंड की अवधि और 2K रिज़ॉल्यूशन तक नेटिव स्टीरियो ध्वनि के साथ वीडियो जनरेट करता है।

lab Hugging Face Blog · 19 दिन पहले · 23 बार देखा गया

NVIDIA ने Cosmos-H-Dreams का परिचय दिया, जो शल्य चिकित्सा रोबोटिक्स के लिए एक रियल-टाइम जनरेटिव सिमुलेटर है

NVIDIA ने Cosmos-H-Dreams का परिचय दिया, जो शल्य चिकित्सा रोबोटिक्स के लिए एक रियल-टाइम, एक्शन-कंडीशन्ड जनरेटिव सिमुलेटर है जो Cosmos-H-Surgical-Simulator की क्षमताओं को एक काज़ुअल स्टूडेंट मॉडल में संक्षिप्त करता है। NVIDIA के FlashDreams त्वरित स्ट्रीमिंग-इनफरेंस लाइब्रेरी के माध्यम से सेवा प्राप्त करते हुए, यह सिस्टम बंद लूप में एक व्यक्ति या सीखी गई पॉलिसी द्वारा इंटरैक्टिव कंट्रोल को सक्षम बनाता है।

media MarkTechPost · 19 दिन पहले · 1 बार देखा गया

ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया, जो छवि, वीडियो, ऑडियो और रोबोट एक्शन भविष्यवाणी के लिए एक बहुआयामी फ्लो मॉडल है

ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया है, जो छवियों, वीडियो और ऑडियो से एक ही आर्किटेक्चर में सीखने वाला एक बहुआयामी आधार मॉडल है। यह पहला FLUX मॉडल है जिसने एक ही सेट के वजन से वीडियो, ऑडियो और एक्शन भविष्यवाणी को शिप किया है।

media Latent Space · 22 दिन पहले · 8 बार देखा गया

Black Forest Labs ने FLUX 3 मल्टीमोडल फ्लो मॉडल्स और FLUX-mimic रोबोटिक्स मॉडल जारी किए

Black Forest Labs ने FLUX 3 लॉन्च किया है, जो एक मल्टीमोडल फ्लो मॉडल फैमिली है जिसमें नैटिव ऑडियो के साथ वीडियो जनरेशन क्षमताएं शामिल हैं। इस रिलीज़ में FLUX-mimic भी पेश किया गया है, जो वीडियो-एक्शन रोबोटिक्स अनुप्रयोगों के लिए डिज़ाइन किया गया एक वेरिएंट है।

lab Hugging Face Blog · 28 दिन पहले · 5 बार देखा गया

NVIDIA NeMo Automodel ने Hugging Face Diffusers के साथ वितरित डिफ्यूजन मॉडल फाइन-ट्यूनिंग को सक्षम बनाया

NVIDIA और Hugging Face ने NVIDIA NeMo Automodel को 🤗 Diffusers लाइब्रेरी के साथ एकीकृत किया है ताकि ओपन-सोर्स डिफ्यूजन मॉडल्स के लिए उत्पादन-स्तरीय, वितरित प्रशिक्षण प्रदान किया जा सके। इस सहयोग से उपयोगकर्ताओं को किसी भी Diffusers-फॉर्मेट मॉडल को Hugging Face Hub पर बिना चेकपॉइंट रूपांतरण या मॉडल कोड पुनर्लेखन की आवश्यकता के फाइन-ट्यून करने की अनुमति मिलती है।

media r/LocalLLaMA · 29 दिन पहले · 1 बार देखा गया

Kimi K3 रिलीज वीडियो सुधारित रचनात्मक कार्यों को प्रदर्शित करता है

एक वायरल वीडियो जो Kimi K3 को मॉडल प्रदाता के रूप में उपयोग करके जनरेट किया गया था, साझा किया गया है, जिसने रचनात्मक कार्यों में इसकी क्षमताओं को दिखाया है। निर्माता ने नोट किया कि आउटपुट गुणवत्ता GLM 5.2 का उपयोग करने वाले पिछले उदाहरणों की तुलना में काफी बेहतर लगती है।

lab NVIDIA Technical Blog · 29 दिन पहले · 1 बार देखा गया

NVIDIA संदर्भ-जागरूक वीडियो AI एजेंट्स को एंटरप्राइज़ वर्कफ़्लो में एकीकृत करने पर चर्चा कर रहा है

एक वीडियो विश्लेषण AI एजेंट जो विशाल मात्रा में वीडियो फुटेज को संवेदनशीलता, तर्क और क्रिया में सक्षम हो, उपयोगी होने के लिए मौजूदा वर्कफ़्लो के साथ एकीकृत होना चाहिए। इन वर्कफ़्लो में सामग्री प्रबंधन प्रणालियाँ, मैसेजिंग प्लेटफ़ॉर्म, डेटाबेस, टिकट कतारें और एस्केलेशन मार्ग शामिल हैं।