Image generation
media TLDR AI · 2 घंटे पहले AIME 2024 · 50.0% · 9 बार देखा गया

मेटा ने Muse कनेक्टर खोले, SAM 3.1 जारी किया, और Gemini ने सिस्टम हैक किए

यह अपडेट AI परिदृश्य में कई विकास को कवर करता है, जिसमें मेटा द्वारा अपनी Muse प्लेटफ़ॉर्म को तीसरे पक्ष के डेवलपर्स के लिए खोलना, अपने सेगमेंटेशन मॉडल का नया संस्करण जारी करना और Google के Gemini से जुड़ा एक सुरक्षा घटना शामिल है।

media MarkTechPost · 2 दिन पहले · 14 बार देखा गया

अलibaba क्वेन ने छवि उत्पादन और संपादन के लिए एकत्रीकृत 7B Qwen-Image-2.1 मॉडल जारी किया

अलibaba की क्वेन टीम ने Qwen-Image-2.1 जारी किया है, जो एकत्रीकृत टेक्स्ट-टू-इमेज जनरेशन और इमेज संपादन मॉडल है जो पिछले अलग-अलग चेकपॉइंट्स को एकल 7B पैरामीटर डिफ्यूजन ट्रांसफॉर्मर में समेटता है।

media Hugging Face Forums · 11 दिन पहले · 18 बार देखा गया

बैडरामोनी ने मिश्रित LoRA और LoKR एडाप्टर्स को मिलाकर Krea 2 Turbo फोटोरियलिज्म LoRA जारी किया

बैडरामोनी ने Krea-2-Turbo मॉडल के लिए एक नया एडाप्टर जारी किया है जो अलग-अलग प्रारूपों के सार्वजनिक रियलिज्म पैक को एक ही फ़ाइल में जोड़ता है। यह रिलीज़ उस सीमा को दूर करती है जहाँ मानक मर्जर टूल्स क्लासिक LoRA और LoKR एडाप्टर्स को संयोजित करने में विफल रहते हैं क्योंकि वे समान लो-रैंक प्रारूप साझा नहीं करते।

media Hugging Face Forums · 11 दिन पहले · 9 बार देखा गया

Diffusers-workflow एजेंटों को MCP के माध्यम से GPU छवि और वीडियो जनरेशन चलाने की सुविधा देता है

Diffusers-workflow एक घोषणात्मक इंजन है जो Hugging Face Diffusers पर बनाया गया है, जो बड़े भाषा मॉडल एजेंटों को JSON दस्तावेज़ों का उपयोग करके छवि या वीडियो पाइपलाइन बनाने, सत्यापित, चलाने और निरीक्षण करने की अनुमति देता है, न कि Python स्क्रिप्ट्स के माध्यम से। यह प्राथमिक इंटरफ़ेस के रूप में लगभग 50 टूल्स वाले एक MCP सर्वर को उजागर करता है, जो GPU संसाधनों पर अनादेक्ष एजेंट नियंत्रण सक्षम बनाता है।

lab Hugging Face Blog · 13 दिन पहले · 24 बार देखा गया

ग्रैडियो ने Workflow1111 जारी किया, AUTOMATIC1111 की सुविधाओं को ग्रैडियो ग्राफ के रूप में पुनर्निर्मित करते हुए

ग्रैडियो ने Workflow1111 जारी किया है, एक परियोजना जो gr.Workflow फ्रेमवर्क का उपयोग करके AUTOMATIC1111 के stable-diffusion-webui सुविधा सेट का अधिकांश पुनर्निर्माण करती है। इस एप्लिकेशन में सातानवे नोड्स से बने ग्यारह मीडिया पाइपलाइन वाले एकल कैनवास पर शामिल हैं, जिनमें टेक्स्ट-टू-इमेज, इमेज-टू-वीडियो और विभिन्न प्रीप्रोसेसिंग कार्य शामिल हैं।

lab Google — The Keyword (AI) · 14 दिन पहले · 36 बार देखा गया

Google DeepMind ने दस्तावेज़ी फिल्म के लिए एक जोड़े की अरिकॉर्डेड याद को पुनर्निर्मित करने के लिए AI का उपयोग किया

फिल्म निर्माता Liz Garbus और Primordial Soup के सहयोग से, Google DeepMind ने "Love, Rendered" दस्तावेज़ी शॉर्ट के लिए Burt और Ethelle Shatz के बीच एक अफोटोग्राफेड मुलाकात को पुनर्निर्मित करने के लिए जनरेटिव AI मॉडल का उपयोग किया। परियोजना जोड़े के दिमाग में मौजूद विशिष्ट याद को पुनर्निर्मित करके संज्ञानात्मक गिरावट से निपटती है।

media r/LocalLLaMA · 14 दिन पहले · 30 बार देखा गया

gtrg55 ने स्थानीय छवि उत्पन्न करने के लिए INT4 क्वांटाइज्ड NVIDIA Cosmos3 64B जारी किया

एक उपयोगकर्ता ने INT4 क्वांटीकरण का उपयोग करके NVIDIA के 64-अरब पैरामीटर वाले Cosmos3 मॉडल को स्थानीय रूप से चलाने के लिए कोड और वजन प्रकाशित किए हैं। इस कार्यान्वयन में Apple Silicon पर MLX के माध्यम से और CUDA दोनों पर टेक्स्ट-टू-इमेज और इमेज-टू-वीडियो कार्य सहायता प्राप्त है।

blog Simon Willison · 14 दिन पहले · 18 बार देखा गया

OpenAI ने बेहतर निर्देश पालन और संदर्भ फोटो सुरक्षा के साथ ChatGPT Images 2.5 जारी किया

OpenAI ने अपनी छवि जनरेट करने वाली मॉडल में अपडेट, ChatGPT Images 2.5 जारी किया है जो कई चरणों में निर्देशों का पालन करने की क्षमता को बढ़ाता है और प्रतिक्रिया गति को तेज करता है। नया संस्करण उपयोगकर्ताओं द्वारा प्रदान किए गए संदर्भ फोटो से विषयों को बनाए रखने में भी बेहतर है।

lab OpenAI News · 15 दिन पहले · 22 बार देखा गया

OpenAI ने तेज़ विवरण, तेज़ जनरेशन और नए संपादन उपकरणों के साथ ChatGPT Images 2.5 पेश किया

OpenAI ने ChatGPT Images 2.5 जारी किया है, जो एक नई स्टेट-ऑफ़-द-आर्ट इमेज मॉडल है जो पिछले संस्करण की तुलना में तेज़ विवरण, अधिक सटीक संपादन क्षमताएं और 50% तक तेज़ जनरेशन प्रदान करती है।

lab Hugging Face Blog · 20 दिन पहले · 29 बार देखा गया

OpenEnv ने TRL का उपयोग करके सूर्य नर्रेदी के वॉटरकलर पेंटिंग मॉडल को पुन: उत्पन्न किया

एक इंजीनियर ने सूर्य नर्रेदी के वायरल प्रोजेक्ट की एक प्रतिलिपि को ओपन-सोर्स किया, जो जावास्क्रिप्ट और रीइन्फोर्सेमेंट लर्निंग का उपयोग करके एक कोडिंग मॉडल को वॉटरकलर पेंट करने के लिए प्रशिक्षित करता है। इस कार्यान्वयन में TRL लाइब्रेरी और OpenEnv का उपयोग Hugging Face पर प्रशिक्षण, स्कोरिंग और इनफरेंस के लिए एक एंड-टू-एंड पाइपलाइन बनाने के लिए किया गया है।

lab Google — The Keyword (AI) · 22 दिन पहले · 21 बार देखा गया

Google ने Workspace सब्सक्राइबर्स के लिए Pics इमेज क्रिएशन टूल लॉन्च किया

Google आने वाली कुछ हफ्तों में सभी Google AI Pro और Ultra सब्सक्राइबर्स और अधिकांश Workspace बिज़नेस ग्राहकों के लिए Nano Banana मॉडल पर बनाई गई इमेज क्रिएशन और एडिटिंग टूल Google Pics को रोल आउट कर रहा है।