Video generation
media AI News (smol.ai) · 4 दिन पहले · 2 बार देखा गया

Qwen, NVIDIA, Mistral और Black Forest Labs ने नए मॉडल जारी किए; राउटिंग और सुरक्षा पर ध्यान केंद्रित

यह 3-4 अगस्त 2026 के लिए AI समाचार समीक्षा Alibaba Qwen, NVIDIA, Mistral AI और Black Forest Labs से महत्वपूर्ण मॉडल रिलीज़, एजेंट राउटिंग, इंफ्रास्ट्रक्चर और साइबर सुरक्षा में विकास को कवर करती है।

media MarkTechPost · 8 दिन पहले · 15 बार देखा गया

मिनीमैक्स ने मिनीमैक्स एच3 जारी किया, एक ओम्नी-मोडल वीडियो मॉडल जो 2K क्लिप को नेटिव स्टीरियो ऑडियो के साथ जनरेट करता है

मिनीमैक्स ने मिनीमैक्स एच3 जारी किया, एक सामान्य-उद्देश्य बहु-मोडल जनरेशन मॉडल जो टेक्स्ट, इमेज, वीडियो और ऑडियो को एक ही संदर्भ में एकीकृत करता है ताकि नेटिव स्टीरियो ध्वनि के साथ 15 सेकंड तक लंबे 2K वीडियो क्लिप उत्पन्न किए जा सकें। पिछले स्टैक्स के विपरीत जो विशिष्ट कार्यों के लिए अलग-अलग विशेषज्ञ मॉडल पर निर्भर करते हैं, एच3 उपयोगकर्ताओं को प्राकृतिक भाषा प्रॉम्प्ट्स के माध्यम से संदर्भ और संपादन संबंधों को व्यक्त करने की अनुमति देता है।

lab xAI News · 8 दिन पहले · 5 बार देखा गया

xAI ने Imagine Video 1.5 में छवि और आवाज़ संदर्भ जोड़े हैं

xAI ने अपने Imagine Video 1.5 मॉडल को अपडेट किया है ताकि यह पाठ, छवि और आवाज़ संदर्भों का समर्थन कर सके, जिससे उपयोगकर्ता 1080p रिज़ॉल्यूशन तक वीडियो जनरेट कर सकते हैं। इस अपडेट के साथ दृश्यों में चेहरे और आवाज़ को लॉक करके पात्रों की स्थिरता सुनिश्चित की जा सकती है, और प्रत्येक जनरेशन के लिए सात संदर्भों तक का समर्थन मिलता है।

media r/LocalLLaMA · 9 दिन पहले · 6 बार देखा गया

MiniMax जल्द ही ओपन वेट्स के साथ MiniMax H3 वीडियो मॉडल जारी करेगा

MiniMax ने MiniMax H3 लॉन्च किया है, जो एक सामान्य-उद्देश्य बहुआयामी जनरेटिव मॉडल है जो टेक्स्ट, छवियों, वीडियो और ऑडियो के बीच एकीकृत संदर्भ को समझता है। यह मॉडल 15 सेकंड की अवधि और 2K रिज़ॉल्यूशन तक नेटिव स्टीरियो ध्वनि के साथ वीडियो जनरेट करता है।

lab Hugging Face Blog · 13 दिन पहले · 19 बार देखा गया

NVIDIA ने Cosmos-H-Dreams का परिचय दिया, जो शल्य चिकित्सा रोबोटिक्स के लिए एक रियल-टाइम जनरेटिव सिमुलेटर है

NVIDIA ने Cosmos-H-Dreams का परिचय दिया, जो शल्य चिकित्सा रोबोटिक्स के लिए एक रियल-टाइम, एक्शन-कंडीशन्ड जनरेटिव सिमुलेटर है जो Cosmos-H-Surgical-Simulator की क्षमताओं को एक काज़ुअल स्टूडेंट मॉडल में संक्षिप्त करता है। NVIDIA के FlashDreams त्वरित स्ट्रीमिंग-इनफरेंस लाइब्रेरी के माध्यम से सेवा प्राप्त करते हुए, यह सिस्टम बंद लूप में एक व्यक्ति या सीखी गई पॉलिसी द्वारा इंटरैक्टिव कंट्रोल को सक्षम बनाता है।

media MarkTechPost · 13 दिन पहले · 1 बार देखा गया

ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया, जो छवि, वीडियो, ऑडियो और रोबोट एक्शन भविष्यवाणी के लिए एक बहुआयामी फ्लो मॉडल है

ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया है, जो छवियों, वीडियो और ऑडियो से एक ही आर्किटेक्चर में सीखने वाला एक बहुआयामी आधार मॉडल है। यह पहला FLUX मॉडल है जिसने एक ही सेट के वजन से वीडियो, ऑडियो और एक्शन भविष्यवाणी को शिप किया है।

media Latent Space · 16 दिन पहले · 4 बार देखा गया

Black Forest Labs ने FLUX 3 मल्टीमोडल फ्लो मॉडल्स और FLUX-mimic रोबोटिक्स मॉडल जारी किए

Black Forest Labs ने FLUX 3 लॉन्च किया है, जो एक मल्टीमोडल फ्लो मॉडल फैमिली है जिसमें नैटिव ऑडियो के साथ वीडियो जनरेशन क्षमताएं शामिल हैं। इस रिलीज़ में FLUX-mimic भी पेश किया गया है, जो वीडियो-एक्शन रोबोटिक्स अनुप्रयोगों के लिए डिज़ाइन किया गया एक वेरिएंट है।

lab Hugging Face Blog · 23 दिन पहले · 5 बार देखा गया

NVIDIA NeMo Automodel ने Hugging Face Diffusers के साथ वितरित डिफ्यूजन मॉडल फाइन-ट्यूनिंग को सक्षम बनाया

NVIDIA और Hugging Face ने NVIDIA NeMo Automodel को 🤗 Diffusers लाइब्रेरी के साथ एकीकृत किया है ताकि ओपन-सोर्स डिफ्यूजन मॉडल्स के लिए उत्पादन-स्तरीय, वितरित प्रशिक्षण प्रदान किया जा सके। इस सहयोग से उपयोगकर्ताओं को किसी भी Diffusers-फॉर्मेट मॉडल को Hugging Face Hub पर बिना चेकपॉइंट रूपांतरण या मॉडल कोड पुनर्लेखन की आवश्यकता के फाइन-ट्यून करने की अनुमति मिलती है।

lab Google — The Keyword (AI) · 23 दिन पहले · 6 बार देखा गया

Google ने Google Vids में Gemini Omni और व्यक्तिगत अवतार जोड़े

Google ने Google Vids के लिए दो नए अपडेट जारी किए: टेक्स्ट-आधारित वीडियो निर्माण और संपादन के लिए Gemini Omni का एकीकरण, और एक विशेषता जो उपयोगकर्ताओं को व्यक्तिगत डिजिटल अवतार बनाने की अनुमति देती है। ये उपकरण प्राकृतिक भाषा प्रॉम्प्ट्स और छवि संदर्भों से क्लिप्स उत्पन्न करने के साथ-साथ भौतिक रिकॉर्डिंग के बिना वीडियो में अभिनय करने की सुविधा देकर वीडियो निर्माण को सरल बनाने का लक्ष्य रखते हैं।

media r/LocalLLaMA · 24 दिन पहले · 1 बार देखा गया

Kimi K3 रिलीज वीडियो सुधारित रचनात्मक कार्यों को प्रदर्शित करता है

एक वायरल वीडियो जो Kimi K3 को मॉडल प्रदाता के रूप में उपयोग करके जनरेट किया गया था, साझा किया गया है, जिसने रचनात्मक कार्यों में इसकी क्षमताओं को दिखाया है। निर्माता ने नोट किया कि आउटपुट गुणवत्ता GLM 5.2 का उपयोग करने वाले पिछले उदाहरणों की तुलना में काफी बेहतर लगती है।

arxiv arXiv cs.AI · 24 दिन पहले · 2 बार देखा गया

परमाणु गतियों के माध्यम से संगीत-से-नृत्य जनरेशन

शोधकर्ता संगीत-संचालित नृत्य जनरेशन के लिए एक संरचना-जागरूक फ्रेमवर्क पेश करते हैं जो कोरियोग्राफी को निरंतर संकेतों के बजाय परमाणु गतियों की एक अनुक्रम के रूप में मॉडल करता है।

lab NVIDIA Technical Blog · 24 दिन पहले

NVIDIA संदर्भ-जागरूक वीडियो AI एजेंट्स को एंटरप्राइज़ वर्कफ़्लो में एकीकृत करने पर चर्चा कर रहा है

एक वीडियो विश्लेषण AI एजेंट जो विशाल मात्रा में वीडियो फुटेज को संवेदनशीलता, तर्क और क्रिया में सक्षम हो, उपयोगी होने के लिए मौजूदा वर्कफ़्लो के साथ एकीकृत होना चाहिए। इन वर्कफ़्लो में सामग्री प्रबंधन प्रणालियाँ, मैसेजिंग प्लेटफ़ॉर्म, डेटाबेस, टिकट कतारें और एस्केलेशन मार्ग शामिल हैं।

arxiv arXiv cs.CL · 24 दिन पहले

Text2Sign: टेक्स्ट-टू-साइन लैंग्वेज वीडियो जनरेशन के लिए सिंगल-GPU डिफ्यूजन बेलाइन

शोधकर्ताओं ने Text2Sign प्रस्तुत किया, जो एक टेक्स्ट-कंडीश्न्ड डिफ्यूजन मॉडल है जिसका डिज़ाइन सिंगल NVIDIA L4 GPU पर छोटे साइन लैंग्वेज क्लिप्स को जनरेट करने के लिए किया गया है, जिससे वीडियो डिफ्यूजन मॉडल्स के प्रशिक्षण और मूल्यांकन से जुड़ी उच्च लागतों की समस्या का समाधान होता है। सिस्टम एक फ्रोजन विज़न-लैंग्वेज टेक्स्ट एन्कोडर को 3D एन्कोडर-डीकोडर और फैक्टराइज़्ड स्पैटियोटेम्पोरल एटेंशन के साथ जोड़ता है, जिससे गणना की आवश्यकता कम होती है जबकि गति की सततता बनी रहती है।

lab NVIDIA Technical Blog · 24 दिन पहले

NVIDIA DeepStream 9.1 बहु-कैमरा 3D ट्रैकिंग सक्षम करता है

बड़े स्थानों में वीडियो विश्लेषण एप्लिकेशन बनाते हुए डेवलपर्स को कैमरे के दृश्यों के बीच एक ही ऑब्जेक्ट को ट्रैक करना होता है। सिंगल-कैमरा 2D ट्रैकिंग में विश्वसनीय गहराई जानकारी नहीं होती और आमतौर पर जब ऑब्जेक्ट फ्रेम से बाहर जाता है तो उसे खो देती है, जिससे गोदाम सुरक्षा, रिटेल विश्लेषण और स्मार्ट-बिल्डिंग मॉनिटरिंग जैसे एप्लिकेशन सीमित हो जाते हैं।

arxiv arXiv cs.LG · 25 दिन पहले

वीडियो डिफ्यूजन मॉडल में सीरियलिटी गैप

शोधकर्ताओं ने वीडियो डिफ्यूजन मॉडल में "सीरियलिटी गैप" की पहचान की है, जहाँ बहु-बॉल हार्ड-स्फीयर डायनामिक्स सिमुलेशन के दौरान कारण श्रृंखला लंबी होने के साथ प्रदर्शन खराब हो जाता है। नियंत्रित प्रयोग दिखाते हैं कि यह खराबी वीडियो की लंबाई के बजाय निर्भर घटनाओं की संरचनाओं के कारण होती है, क्योंकि बिना अंतःक्रिया वाले सिंगल-बॉल नियंत्रण में यह गायब हो जाती है।

lab NVIDIA Technical Blog · 25 दिन पहले

एजेंट कौशल के साथ NVIDIA Cosmos 3 का पोस्ट-ट्रेनिंग 90% से अधिक सटीकता प्राप्त करता है

NVIDIA दिखाता है कि Cosmos 3 विजन रीज़निंग मॉडल को पोस्ट-ट्रेन करने के लिए स्वतंत्र कोडिंग AI एजेंट्स का उपयोग करने से न्यूनतम मैनुअल प्रयास के साथ सटीकता को 90% से ऊपर ले जाया जा सकता है।

media r/LocalLLaMA · 26 दिन पहले · 1 बार देखा गया

Wan-Dancer संगीत के साथ समकालिक लंबे समय तक सहसंबद्ध नृत्य वीडियो उत्पन्न करता है

शोधकर्ताओं ने Wan-Dancer पेश किया है, एक पदानुक्रमित ढांचा जो संगीत के साथ समकालिक लंबी अवधि और उच्च परिभाषा वाले नृत्य वीडियो उत्पन्न करता है। सिस्टम जनरेशन को वैश्विक की-फ्रेम योजना और स्थानीय कालिक सुधार में अलग करके डिफ्यूजन मॉडल की सामान्य 20-सेकंड की सीमा को पार करता है।

media r/LocalLLaMA · 30 दिन पहले

डेवलपर ने स्थानीय LLM NPC के साथ मुफ्त गेम 'Simulation Simulator' जारी किया

डेवलपर MorphLand ने "Simulation Simulator" नामक एक मुफ्त Steam शीर्षक जारी किया है, जो गेम के अंदर एक NPC के रूप में कार्य करने के लिए स्थानीय बड़े भाषा मॉडल को एकीकृत करता है। गेम एक स्वतंत्र संवाद अनुभव है जहाँ खिलाड़ी अपने AI साथी को यह विश्वास दिलाने का प्रयास करते हैं कि वास्तविकता एक सिमुलेशन है।