Image generation
media TLDR AI · منذ 2 ساعة AIME 2024 · 50.0% · 9 مشاهدات

ميتا تفتح موصلات Muse، وتطلق SAM 3.1، وGemini يخترق الأنظمة

يغطي هذا التحديث عدة تطورات في مشهد الذكاء الاصطناعي، بما في ذلك فتح ميتا لمنصتها Muse أمام مطوري الطرف الثالث، وإصدار إصدار جديد من نموذج التقسيم الخاص بها، وحادث أمني يتعلق بـ Gemini من جوجل.

media MarkTechPost · منذ 2 يوم · 14 مشاهدة

ألبابا كوين تطلق نموذج كوين-إيميج 2.1 الموحد بـ 7 مليار معلمة لتوليد وتحرير الصور

أطلقت فريق كوين التابع لألبابا نموذج كوين-إيميج 2.1، وهو نموذج موحد لتوليد الصور من النص وتحريرها، يدمج نقاط التفتيش المنفصلة السابقة في محوّل انتشار واحد بـ 7 مليار معلمة.

media Hugging Face Forums · منذ 11 يوم · 18 مشاهدة

باداراموني تطلق لورا للواقعية الفوتوغرافية Krea 2 Turbo عن طريق دمج محولات LoRA و LoKR المختلطة

أطلقت باداراموني محولًا جديدًا لنموذج Krea-2-Turbo يجمع بين حزم الواقعية العامة بتنسيقات مختلفة في ملف واحد. يعالج الإصدار القيود حيث تفشل أدوات الدمج القياسية في دمج محولات LoRA و LoKR الكلاسيكية لأنها لا تشارك نفس تنسيق الرتبة المنخفضة.

media Hugging Face Forums · منذ 11 يوم · 9 مشاهدات

يسمح Diffusers-workflow للوكلاء بقيادة توليد الصور والفيديو عبر وحدة معالجة الرسومات باستخدام MCP

Diffusers-workflow هو محرك إعلاني مبني فوق Hugging Face Diffuers يتيح لوكلاء نماذج اللغة الكبيرة تأليف، والتحقق، وتشغيل، وفحص خطوط أنابيب الصور أو الفيديو باستخدام مستندات JSON بدلاً من نصوص Python. ويعرض خادم MCP مع حوالي 50 أداة كواجهة رئيسية، مما يتيح التحكم غير المراقب للوكلاء في موارد وحدة معالجة الرسومات.

lab Hugging Face Blog · منذ 13 يوم · 24 مشاهدة

Gradio تُصدر Workflow1111، معادًا بناءً ميزات AUTOMATIC1111 كـ رسم بياني Gradio

أصدرت Gradio مشروع Workflow1111، الذي يعيد بناء معظم مجموعة ميزات stable-diffusion-webui الخاصة بـ AUTOMATIC1111 باستخدام إطار عمل gr.Workflow. يتكون التطبيق من لوحة واحدة تحتوي على اثني عشر خط أنابيب وسطي مبنيًا من ثلاثة وسبعين عقدة، تغطي مهام تحويل النص إلى صورة، والصورة إلى فيديو، ومختلف مهام المعالجة المسبقة.

lab Google — The Keyword (AI) · منذ 14 يوم · 36 مشاهدة

جوجل ديب مايند تستخدم الذكاء الاصطناعي لإعادة إنشاء ذكرى غير مسجلة لزوجين لفيلم وثائقي

بالتعاون مع المخرجة ليز غاربوس وبريمورديال سوب، استخدمت جوجل ديب مايند نماذج ذكاء اصطناعي توليدية لإعادة بناء لقاء غير مصور بين بيرت وإثيل شاتز للفيديو الوثائقي القصير "Love, Rendered". يتناول المشروع التدهور المعرفي من خلال إعادة إنشاء ذكرى محددة كانت موجودة فقط في عقل الزوجين.

media r/LocalLLaMA · منذ 14 يوم · 30 مشاهدة

gtrg55 تطلق نسخة NVIDIA Cosmos3 64B المُكمَّاة بـ INT4 للتوليد المحلي للصور

قام مستخدم بنشر الكود والأوزان لتشغيل نموذج Cosmos3 الخاص بشركة NVIDIA الذي يحتوي على 64 مليار معلمة محليًا باستخدام التكمية INT4. تدعم التنفيذ مهام النص إلى صورة والصورة إلى الفيديو على Apple Silicon عبر MLX وكذلك CUDA.

blog Simon Willison · منذ 14 يوم · 18 مشاهدة

OpenAI تطلق ChatGPT Images 2.5 مع تحسين اتباع التعليمات والحفاظ على الصور المرجعية

أطلقت OpenAI تحديث ChatGPT Images 2.5 لنماذج توليد الصور الخاصة بها، والذي يعزز القدرة على اتباع التعليمات عبر دورات متعددة ويزيد من سرعة الاستجابة. الإصدار الجديد أفضل أيضًا في الحفاظ على العناصر من الصور المرجعية التي يقدمها المستخدمون.

lab Hugging Face Blog · منذ 20 يوم · 29 مشاهدة

OpenEnv يُعيد إنتاج نموذج الرسم بالماء لسوريا ناريدي باستخدام TRL

قام مهندس بفتح مصدر نسخة طبق الأصل من مشروع سوريا ناريدي الفيروسي، الذي يدرب نموذج برمجة على رسم ألوان مائية باستخدام جافاسكريبت والتعلم المعزز. تستخدم التنفيذ مكتبة TRL وOpenEnv لإنشاء خط أنابيب متكامل على Hugging Face للتدريب والتقييم والاستنتاج.