Image generation
media r/LocalLLaMA · منذ 9 يوم · 9 مشاهدات

تظهر الاختبارات الأولية لـ DeepSeek v4 Flash تحسينات كبيرة في قدرات تصميم واجهة المستخدم/تجربة المستخدم

تشير الاختبارات الأولية لنموذج DeepSeek v4 Flash إلى تحسن ملحوظ في مهارات تصميم واجهة المستخدم وتجربة المستخدم. وعلى الرغم من هذه التحسينات، يُشار إلى أن النموذج جائع للرموز (tokens).

lab NVIDIA Research · منذ 12 يوم · 8 مشاهدات

تكميم دفتر أكوام متجمع لضغط الصور القائم على غاوس ثنائي الأبعاد

يقدم الباحثون تكميم المتجه الموجه بالعناقيد (CGVQ)، وهي طريقة مصممة لتحسين أداء معدل التشويه في ضغط الصور القائم على البدع الغاوسية. يقسم النهج معاملات غاوس إلى مجموعات متجانسة قبل التكميم، مما يعالج عدم الكفاءة الناتجة عن تخزين أعداد كبيرة من معاملات النقطة العائمة لكل بدعة.

lab Hugging Face Blog · منذ 17 يوم · مشاهدتان

يضيف Diffusers دعمًا أصليًا لاستدلال Nunchaku Lite بدقة 4 بت

يدعم Hugging Face Diffusers الآن تحميل نقاط تفتيش Nunchaku Lite بشكل أصلي عبر `from_pretrained()`، مما يلغي الحاجة إلى محرك استدلال منفصل أو ترجمة CUDA محلية. تستفيد هذه التكاملات من طريقة SVDQuant لتشغيل طبقات المحوّل بأوزان وتنشيطات بدقة 4 بت (W4A4)، مما يقلل بشكل كبير من استخدام الذاكرة مع تحسين سرعة الاستدلال.

media r/LocalLLaMA · منذ 17 يوم · 5 مشاهدات

مايكروسوفت تطلق Mage-Flow، نموذجًا أصليًا بدقة 4B لتوليد الصور وتعديلها

أطلقت مايكروسوفت Mage-Flow، وهي مجموعة توليدية مدمجة بحجم 4B مصممة للتوليد الفعال للنصوص إلى صور وتحرير الصور بناءً على التعليمات. يحقق النظام جودة تنافسية مع الحالة السائدة من خلال التصميم المشترك لمُرمِّز خفيف الوزن يُدعى Mage-VAE ومحول الانتشار متعدد الوسائط بدقة أصلية (NR-MMDiT).

lab Hugging Face Blog · منذ 23 يوم · 5 مشاهدات

تمكين NVIDIA NeMo Automodel من ضبط نموذج الانتشار الموزع مع Hugging Face Diffusers

قامت NVIDIA وHugging Face بدمج NVIDIA NeMo Automodel مع مكتبة 🤗 Diffusers لتوفير تدريب موزع من الدرجة الإنتاجية لنماذج الانتشار مفتوحة المصدر. يتيح هذا التعاون للمستخدمين ضبط أي نموذج بتنسيق Diffusers على Hugging Face Hub دون الحاجة إلى تحويل نقاط التفتيش أو إعادة كتابة كود النموذج.

arxiv arXiv cs.AI · منذ 26 يوم · مشاهدة واحدة

يتيح CtrlVTON تجربة افتراضية قابلة للتحكم عبر تقسيم دعوة المثيل البصري

يقدم المؤلفون إطار عمل CtrlVTON، الذي يعالج نقص تحكم المستخدم في التجربة الافتراضية عن طريق إعادة صياغة المهمة على أنها تعديل صور بقناع تقسيم على مستوى البكسل. يسمح هذا النهج للمستخدمين بتحديد حجم الملابس، والأسلوب، والموضع المكاني على الجسم.

media Hugging Face Forums · منذ 28 يوم

يستخدم HoLo-FuSe ركيزة HSL ذات 0 معلمة لتوليد الصور المشروطة بالفئة

يُظهر HoLo-FuSe أن ركيزة بايت HoLo Semantic Layer (HSL) المتجمدة وذات الصفر معلمة يمكنها بشكل فعال تكييف نموذج الانتشار لتوليد الصور. يختبر المشروع ما إذا كان إطار الميزات الحتمي ذو 27 بُعدًا هذا يمكن أن يعمل كآلية تكييف لـ DDPM المشروط بالفئة، مستبدلاً التضمينات المتعلمة التقليدية.

media r/LocalLLaMA · منذ 28 يوم · 3 مشاهدات

ZimengXiong ينقل Hunyuan3D إلى MLX لأجهزة Apple Silicon وiPhone

أكمل المطور ZimengXiong نقل نماذج Hunyuan3D-Paint وHunyuan3D-Shape إلى Swift-MLX وPython MLX، مما يتيح توليد الصور إلى ثلاثي الأبعاد محليًا على أجهزة Apple Silicon. يتم توزيع العمل كتطبيق سطح مكتب مفتوح المصدر Modelr لنظامي macOS وiOS، بالإضافة إلى الكود المصدري لدمج التقنية في تطبيقات Swift.

media r/LocalLLaMA · منذ 29 يوم

Fabricio3g تطلق Flaxeo Image، واجهة سطح مكتب محلية لـ stable diffusion cpp

أطلقت Fabricio3t تطبيق Flaxeo Image، وهو واجهة مستخدم لسطح المكتب المحلي مبنية حول الإصدار الأخير من sd.cpp. تهدف التطبيق إلى كشف معظم قدرات الخلفية، بما في ذلك التوليد، والتحرير، ومسارات الفيديو، وإدارة النماذج، وخيارات الأجهزة.