विषय · Image generation
lab xAI News · 7 दिन पहले · 21 बार देखा गया

xAI ने Imagine Image 2.0 को सटीक संपादन और लेआउट क्षमताओं के साथ जारी किया

xAI ने Imagine Image 2.0 को नए क्वालिटी मोड, iOS और Android ऐप्स के रूप में सामान्य उपलब्ध करा दिया है। यह अपडेट पेशेवर रचनात्मक कार्यप्रवाहों के लिए सटीक छवि निर्माण और संपादन पर केंद्रित है।

lab NVIDIA Research · 3 घंटे पहले · 2 बार देखा गया

Nvidia ने हाइब्रिड डोमेन नॉलेज फ्यूजन के माध्यम से रियल-टाइम पोर्ट्रेट रिलिटिंग के लिए FusionRelight प्रस्तुत किया

Nvidia के शोधकर्ताओं ने FusionRelight पेश किया है, जो एक विधि है जो भौतिक रूप से युक्तिसंगत प्रकाश स्थानांतरण को पहचान संरक्षण और संपीड़ित रियल-टाइम इनफरेंस के साथ जोड़ती है। यह दृष्टिकोण हाइब्रिड डोमेन नॉलेज फ्यूजन (HDKF) का उपयोग करता है, एक प्रशिक्षण ढांचा जो सिंथेटिक, वन-लाइट-एट-ए-टाइम (OLAT), और इन-द-वाइल्ड डेटा से भौतिकी, प्रतिबिंब और यथार्थता के पूर्वज्ञान को एक छात्र मॉडल में संक्षिप्त करता है।

lab NVIDIA Research · 18 दिन पहले · 13 बार देखा गया

2D गॉसियन-आधारित छवि संपीड़न के लिए क्लस्टर कोडबुक क्वांटीकरण

शोधकर्ता Cluster-Guided Vector Quantization (CGVQ) प्रस्तुत करते हैं, जो गॉसियन प्राइमिटिव-आधारित छवि संपीड़न में दर-विकृति प्रदर्शन को बेहतर बनाने के लिए डिज़ाइन किया गया एक विधि है। दृष्टिकोण क्वांटीकरण से पहले गॉसियन पैरामीटर को समजात समूहों में विभाजित करता है, जिसमें प्रति प्राइमिटिव बड़ी संख्या में फ्लोटिंग-पॉइंट पैरामीटर संग्रहीत करने के कारण होने वाली अक्षमता को दूर किया जाता है।

lab NVIDIA Research · 23 दिन पहले · 1 बार देखा गया

NVIDIA ने गेम्स में नियंत्रणीय जनरेटिव ग्राफिक्स के लिए CTRL-G पेश किया

NVIDIA ने CTRL-G (Controllable Generative Graphics for Games) पेश किया है, जो इंटरैक्टिव गेम वातावरण के भीतर जनरेटिव AI सिस्टम को नियंत्रित करने की चुनौती को संबोधित करने के लिए डिज़ाइन किया गया एक फ्रेमवर्क है।

media TLDR AI · 23 दिन पहले · 1 बार देखा गया

Google ने Gemini 3.6 Flash जारी किया; OpenAI ने मॉडल सुरक्षा पलायन की रिपोर्ट की

Google ने तीन नए मॉडल जारी किए हैं: कुशल सामान्य-उद्देश्य एजेंट कार्यभार के लिए Gemini 3.6 Flash, कम विलंबता वाले अनुप्रयोगों के लिए 3.5 Flash-Lite, और CodeMender के साथ एकीकृत साइबर-विशेषज्ञ 3.5 Flash मॉडल।

media r/LocalLLaMA · 4 दिन पहले · 6 बार देखा गया

Google ने DiffusionGemma तकनीकी रिपोर्ट जारी की

Google ने arXiv पर उपलब्ध DiffusionGemma के लिए एक तकनीकी रिपोर्ट प्रकाशित की है। दस्तावेज़ में Gemma परिवार के हिस्से के रूप में मॉडल की वास्तुकला और क्षमताओं का विवरण दिया गया है।

media r/LocalLLaMA · 14 दिन पहले · 13 बार देखा गया

DeepSeek v4 Flash का प्रारंभिक परीक्षण UI/UX डिज़ाइन क्षमताओं में महत्वपूर्ण सुधार दिखाता है

DeepSeek v4 Flash मॉडल का प्रारंभिक परीक्षण इसके उपयोगकर्ता इंटरफ़ेस और उपयोगकर्ता अनुभव डिज़ाइन कौशल में उल्लेखनीय सुधार की ओर इशारा करता है। इन सुधारों के बावजूद, मॉडल को टोकन-भूखा बताया गया है।

media Hugging Face Forums · 18 दिन पहले

Kavram ने FLUX.1 Schnell मूल्य निर्धारण के साथ वितरित अतुल्यकालिक छवि API प्रदान की है

Kavram एक उत्पादन छवि जनरेट करने वाली API का परीक्षण कर रहा है जो पाइपलाइन-विभाजित वितरित GPU नेटवर्क का उपयोग करती है, जिससे डेवलपर हार्डवेयर को स्वयं प्रबंधित किए बिना खुले छवि मॉडल तैनात कर सकें।

lab Hugging Face Blog · 23 दिन पहले · 3 बार देखा गया

Diffusers में Nunchaku Lite 4-बिट इनफरेंस के लिए नेटिव समर्थन जोड़ा गया

Hugging Face Diffusers अब `from_pretrained()` के माध्यम से Nunchaku Lite चेकपॉइंट्स को नेटिव रूप से लोड करने का समर्थन करता है, जिससे अलग इनफरेंस इंजन या स्थानीय CUDA कंपाइलेशन की आवश्यकता समाप्त हो जाती है। यह एकीकरण SVDQuant विधि का उपयोग करके 4-बिट वेट्स और एक्टिवेशन (W4A4) के साथ ट्रांसफॉर्मर लेयर को चलाता है, जिससे मेमोरी उपयोग काफी कम होता है और इनफरेंस गति में सुधार होता है।

media r/LocalLLaMA · 23 दिन पहले · 6 बार देखा गया

माइक्रोसॉफ्ट ने इमेज जनरेशन और एडिटिंग के लिए 4B नेटिव-रेज़ोल्यूशन मॉडल Mage-Flow जारी किया

माइक्रोसॉफ्ट ने Mage-Flow जारी किया है, जो कुशल टेक्स्ट-टू-इमेज जनरेशन और निर्देश-आधारित इमेज एडिटिंग के लिए डिज़ाइन किया गया एक कॉम्पैक्ट 4B-स्केल जेनेरेटिव स्टैक है। इस सिस्टम ने लाइटवेट टोकनाइजर, Mage-VAE, और नेटिव-रेज़ोल्यूशन मल्टीमोडल डिफ्यूजन ट्रान्सफॉर्मर (NR-MMDiT) के सह-डिज़ाइन के माध्यम से स्टेट-ऑफ़-द-आर्ट-कम्पिटिटिव गुणवत्ता हासिल की है।

lab Hugging Face Blog · 28 दिन पहले · 5 बार देखा गया

NVIDIA NeMo Automodel ने Hugging Face Diffusers के साथ वितरित डिफ्यूजन मॉडल फाइन-ट्यूनिंग को सक्षम बनाया

NVIDIA और Hugging Face ने NVIDIA NeMo Automodel को 🤗 Diffusers लाइब्रेरी के साथ एकीकृत किया है ताकि ओपन-सोर्स डिफ्यूजन मॉडल्स के लिए उत्पादन-स्तरीय, वितरित प्रशिक्षण प्रदान किया जा सके। इस सहयोग से उपयोगकर्ताओं को किसी भी Diffusers-फॉर्मेट मॉडल को Hugging Face Hub पर बिना चेकपॉइंट रूपांतरण या मॉडल कोड पुनर्लेखन की आवश्यकता के फाइन-ट्यून करने की अनुमति मिलती है।

media Hugging Face Forums · 30 दिन पहले · 21 बार देखा गया

उपयोगकर्ता ने FireRed Image Edit v1.1 के लिए INT8 ConvRot क्वांटीकरण का अनुरोध किया

Hugging Face फोरम पर एक उपयोगकर्ता FireRed Image Edit v1.1 मॉडल के लिए INT8 या FP8 ConvRot संस्करण के संभावित विकास के बारे में पूछ रहा है।

media Hugging Face Forums · 27 दिन पहले

toyxyz के Anima-Artist-Mixer तुलना में चित्र B के लिए कलाकार टैग की खोज

Hugging Face चर्चा मंच पर एक उपयोगकर्ता toyxyz द्वारा पोस्ट किए गए तुलना छवि में "चित्र B" के लिए उपयोग किए गए विशिष्ट कलाकार टैग को पहचानने के लिए समुदाय से अनुरोध कर रहा है।