Image generation
lab xAI News · 23 घंटे पहले · 11 बार देखा गया

xAI ने Imagine Image 2.0 को सटीक संपादन और लेआउट क्षमताओं के साथ जारी किया

xAI ने Imagine Image 2.0 को नए क्वालिटी मोड, iOS और Android ऐप्स के रूप में सामान्य उपलब्ध करा दिया है। यह अपडेट पेशेवर रचनात्मक कार्यप्रवाहों के लिए सटीक छवि निर्माण और संपादन पर केंद्रित है।

media r/LocalLLaMA · 9 दिन पहले · 9 बार देखा गया

DeepSeek v4 Flash का प्रारंभिक परीक्षण UI/UX डिज़ाइन क्षमताओं में महत्वपूर्ण सुधार दिखाता है

DeepSeek v4 Flash मॉडल का प्रारंभिक परीक्षण इसके उपयोगकर्ता इंटरफ़ेस और उपयोगकर्ता अनुभव डिज़ाइन कौशल में उल्लेखनीय सुधार की ओर इशारा करता है। इन सुधारों के बावजूद, मॉडल को टोकन-भूखा बताया गया है।

lab NVIDIA Research · 12 दिन पहले · 8 बार देखा गया

2D गॉसियन-आधारित छवि संपीड़न के लिए क्लस्टर कोडबुक क्वांटीकरण

शोधकर्ता Cluster-Guided Vector Quantization (CGVQ) प्रस्तुत करते हैं, जो गॉसियन प्राइमिटिव-आधारित छवि संपीड़न में दर-विकृति प्रदर्शन को बेहतर बनाने के लिए डिज़ाइन किया गया एक विधि है। दृष्टिकोण क्वांटीकरण से पहले गॉसियन पैरामीटर को समजात समूहों में विभाजित करता है, जिसमें प्रति प्राइमिटिव बड़ी संख्या में फ्लोटिंग-पॉइंट पैरामीटर संग्रहीत करने के कारण होने वाली अक्षमता को दूर किया जाता है।

media Hugging Face Forums · 13 दिन पहले

Kavram ने FLUX.1 Schnell मूल्य निर्धारण के साथ वितरित अतुल्यकालिक छवि API प्रदान की है

Kavram एक उत्पादन छवि जनरेट करने वाली API का परीक्षण कर रहा है जो पाइपलाइन-विभाजित वितरित GPU नेटवर्क का उपयोग करती है, जिससे डेवलपर हार्डवेयर को स्वयं प्रबंधित किए बिना खुले छवि मॉडल तैनात कर सकें।

lab Hugging Face Blog · 17 दिन पहले · 2 बार देखा गया

Diffusers में Nunchaku Lite 4-बिट इनफरेंस के लिए नेटिव समर्थन जोड़ा गया

Hugging Face Diffusers अब `from_pretrained()` के माध्यम से Nunchaku Lite चेकपॉइंट्स को नेटिव रूप से लोड करने का समर्थन करता है, जिससे अलग इनफरेंस इंजन या स्थानीय CUDA कंपाइलेशन की आवश्यकता समाप्त हो जाती है। यह एकीकरण SVDQuant विधि का उपयोग करके 4-बिट वेट्स और एक्टिवेशन (W4A4) के साथ ट्रांसफॉर्मर लेयर को चलाता है, जिससे मेमोरी उपयोग काफी कम होता है और इनफरेंस गति में सुधार होता है।

media r/LocalLLaMA · 17 दिन पहले · 5 बार देखा गया

माइक्रोसॉफ्ट ने इमेज जनरेशन और एडिटिंग के लिए 4B नेटिव-रेज़ोल्यूशन मॉडल Mage-Flow जारी किया

माइक्रोसॉफ्ट ने Mage-Flow जारी किया है, जो कुशल टेक्स्ट-टू-इमेज जनरेशन और निर्देश-आधारित इमेज एडिटिंग के लिए डिज़ाइन किया गया एक कॉम्पैक्ट 4B-स्केल जेनेरेटिव स्टैक है। इस सिस्टम ने लाइटवेट टोकनाइजर, Mage-VAE, और नेटिव-रेज़ोल्यूशन मल्टीमोडल डिफ्यूजन ट्रान्सफॉर्मर (NR-MMDiT) के सह-डिज़ाइन के माध्यम से स्टेट-ऑफ़-द-आर्ट-कम्पिटिटिव गुणवत्ता हासिल की है।

lab NVIDIA Research · 17 दिन पहले · 1 बार देखा गया

NVIDIA ने गेम्स में नियंत्रणीय जनरेटिव ग्राफिक्स के लिए CTRL-G पेश किया

NVIDIA ने CTRL-G (Controllable Generative Graphics for Games) पेश किया है, जो इंटरैक्टिव गेम वातावरण के भीतर जनरेटिव AI सिस्टम को नियंत्रित करने की चुनौती को संबोधित करने के लिए डिज़ाइन किया गया एक फ्रेमवर्क है।

media TLDR AI · 18 दिन पहले · 1 बार देखा गया

Google ने Gemini 3.6 Flash जारी किया; OpenAI ने मॉडल सुरक्षा पलायन की रिपोर्ट की

Google ने तीन नए मॉडल जारी किए हैं: कुशल सामान्य-उद्देश्य एजेंट कार्यभार के लिए Gemini 3.6 Flash, कम विलंबता वाले अनुप्रयोगों के लिए 3.5 Flash-Lite, और CodeMender के साथ एकीकृत साइबर-विशेषज्ञ 3.5 Flash मॉडल।

media Hugging Face Forums · 21 दिन पहले

toyxyz के Anima-Artist-Mixer तुलना में चित्र B के लिए कलाकार टैग की खोज

Hugging Face चर्चा मंच पर एक उपयोगकर्ता toyxyz द्वारा पोस्ट किए गए तुलना छवि में "चित्र B" के लिए उपयोग किए गए विशिष्ट कलाकार टैग को पहचानने के लिए समुदाय से अनुरोध कर रहा है।

lab Hugging Face Blog · 23 दिन पहले · 5 बार देखा गया

NVIDIA NeMo Automodel ने Hugging Face Diffusers के साथ वितरित डिफ्यूजन मॉडल फाइन-ट्यूनिंग को सक्षम बनाया

NVIDIA और Hugging Face ने NVIDIA NeMo Automodel को 🤗 Diffusers लाइब्रेरी के साथ एकीकृत किया है ताकि ओपन-सोर्स डिफ्यूजन मॉडल्स के लिए उत्पादन-स्तरीय, वितरित प्रशिक्षण प्रदान किया जा सके। इस सहयोग से उपयोगकर्ताओं को किसी भी Diffusers-फॉर्मेट मॉडल को Hugging Face Hub पर बिना चेकपॉइंट रूपांतरण या मॉडल कोड पुनर्लेखन की आवश्यकता के फाइन-ट्यून करने की अनुमति मिलती है।

media Hugging Face Forums · 24 दिन पहले · 19 बार देखा गया

उपयोगकर्ता ने FireRed Image Edit v1.1 के लिए INT8 ConvRot क्वांटीकरण का अनुरोध किया

Hugging Face फोरम पर एक उपयोगकर्ता FireRed Image Edit v1.1 मॉडल के लिए INT8 या FP8 ConvRot संस्करण के संभावित विकास के बारे में पूछ रहा है।

blog Simon Willison · 25 दिन पहले · 1 बार देखा गया

सिमन विलिसन ने GPT-5.6 और gpt-image-2 का उपयोग करके Codex Desktop के लिए कस्टम पेट बनाया

सिमन विलिसन OpenAI के GPT-5.6 Sol मॉडल और gpt-image-2 API का लाभ उठाते हुए Codex Desktop एप्लिकेशन के लिए एक कस्टम एनिमेटेड "पेट" कैसे बनाया, यह दिखाते हैं।

lab Google — The Keyword (AI) · 26 दिन पहले · 2 बार देखा गया

Google Images ने नई गैलरी और Nano Banana इमेज जनरेशन पेश किया

अपने 25वें वर्षगांठ को मनाने के लिए, Google Google Images के लिए एक पुनर्डिज़ाइन किए गए, ब्राउज़ करने योग्य होम के साथ-साथ AI Overviews के भीतर नई इमेज जनरेशन क्षमताओं का लॉन्च कर रहा है।

arxiv arXiv cs.AI · 26 दिन पहले · 1 बार देखा गया

CtrlVTON दृश्य-इंस्टेंस-प्रॉम्प्ट सेगमेंटेशन के माध्यम से नियंत्रित वर्चुअल ट्राई-ऑन सक्षम बनाता है

लेखकों ने CtrlVTON पेश किया, एक फ्रेमवर्क जो पिक्सेल-स्तर सेगमेंटेशन मास्क के साथ इमेज एडिटिंग के रूप में कार्य को पुनः परिभाषित करके वर्चुअल ट्राई-ऑन में उपयोगकर्ता नियंत्रण की कमी को दूर करता है। यह दृष्टिकोण उपयोगकर्ताओं को वस्त्र का आकार, शैली और शरीर पर स्थानिक स्थान निर्दिष्ट करने की अनुमति देता है।

media Hugging Face Forums · 28 दिन पहले

HoLo-FuSe क्लास-कंडीशनल इमेज जनरेशन के लिए 0-पैरामीटर HSL सब्सट्रेट का उपयोग करता है

HoLo-FuSe प्रदर्शित करता है कि एक फ्रोजन, ज़ीरो-पैरामीटर HoLo Semantic Layer (HSL) बाइट सब्सट्रेट इमेज जनरेशन के लिए डिफ्यूजन मॉडल को प्रभावी ढंग से कंडीशन कर सकता है। परियोजना इस बात का परीक्षण करती है कि क्या यह निर्धारक 27-D फीचर फ्रेम एक क्लास-कंडीशनल DDPM के लिए कंडीशनिंग तंत्र के रूप में कार्य कर सकता है, पारंपरिक सीखे गए एम्बेडिंग्स को बदलकर।

media r/LocalLLaMA · 28 दिन पहले · 3 बार देखा गया

ZimengXiong ने Apple Silicon और iPhone के लिए MLX पर Hunyuan3D पोर्ट किया

डेवलपर ZimengXiong ने Hunyuan3D-Paint और Hunyuan3D-Shape मॉडल का Swift-MLX और Python MLX पोर्ट पूरा किया है, जिससे Apple Silicon डिवाइस पर स्थानीय रूप से इमेज-टू-3D जनरेशन संभव हुआ है। यह काम macOS और iOS के लिए ओपन-सोर्स Modelr डेस्कटॉप ऐप के रूप में वितरित किया गया है, साथ ही Swift एप्लिकेशन में तकनीक को एकीकृत करने के लिए स्रोत कोड भी उपलब्ध है।

media r/LocalLLaMA · 29 दिन पहले

Fabricio3g ने stable diffusion cpp के लिए एक स्थानीय डेस्कटॉप UI, Flaxeo Image जारी किया

Fabricio3g ने हाल ही में जारी किए गए sd.cpp रिलीज़ के आसपास बनाए गए एक स्थानीय डेस्कटॉप उपयोगकर्ता इंटरफ़ेस, Flaxeo Image को जारी किया है। इस एप्लिकेशन का उद्देश्य बैकएंड की अधिकांश क्षमताओं को प्रदर्शित करना है, जिसमें जनरेशन, एडिटिंग, वीडियो पथ, मॉडल प्रबंधन और हार्डवेयर विकल्प शामिल हैं।