xAI تطلق Imagine Image 2.0 بقدرات دقيقة للتعديل والتخطيط
أطلقت xAI Imagine Image 2.0 بشكل عام كوضع جودة جديد، وتطبيقات iOS وAndroid. يركز التحديث على توليد الصور بدقة عالية وتعديلها لسير العمل الإبداعي الاحترافي.
أطلقت xAI Imagine Image 2.0 بشكل عام كوضع جودة جديد، وتطبيقات iOS وAndroid. يركز التحديث على توليد الصور بدقة عالية وتعديلها لسير العمل الإبداعي الاحترافي.
قدم باحثو إنفيديا FusionRelight، وهي طريقة لإعادة إضاءة البورتريه تجمع بين نقل الإضاءة المادي المعقول والحفاظ على الهوية والاستدلال في الوقت الفعلي المضغوط. تستخدم هذه الطريقة دمج المعرفة الهجينة للمجال (HDKF)، وهو إطار تدريبي يستخلص مسبقاً من الفيزياء والانعكاسية والواقعية من البيانات الاصطناعية، وواحدة-ضوء-في-الوقت (OLAT)، والبيانات في البرية، لنموذج طالب.
يقدم الباحثون تكميم المتجه الموجه بالعناقيد (CGVQ)، وهي طريقة مصممة لتحسين أداء معدل التشويه في ضغط الصور القائم على البدع الغاوسية. يقسم النهج معاملات غاوس إلى مجموعات متجانسة قبل التكميم، مما يعالج عدم الكفاءة الناتجة عن تخزين أعداد كبيرة من معاملات النقطة العائمة لكل بدعة.
أعلنت إنفيديا عن إطلاق CTRL-G (Controllable Generative Graphics for Games)، وهو إطار عمل مصمم لمعالجة تحدي التحكم في أنظمة الذكاء الاصطناعي التوليدي داخل بيئات الألعاب التفاعلية.
أطلقت جوجل ثلاثة نماذج جديدة: Gemini 3.6 Flash لأعباء عمل الوكالات العامة بكفاءة، و3.5 Flash-Lite للتطبيقات منخفضة زمن الوصول، ونموذج 3.5 Flash المتخصص في الأمن السيبراني والمدمج مع CodeMender.
نشرت جوجل تقريرًا فنيًا حول DiffusionGemma، متاح على arXiv. يوضح المستند تفاصيل بنية النموذج وقدراته كجزء من عائلة Gemma.
تشير الاختبارات الأولية لنموذج DeepSeek v4 Flash إلى تحسن ملحوظ في مهارات تصميم واجهة المستخدم وتجربة المستخدم. وعلى الرغم من هذه التحسينات، يُشار إلى أن النموذج جائع للرموز (tokens).
تختبر Kavram واجهة برمجة تطبيقات لتوليد الصور للإنتاج تستخدم شبكة GPU موزعة مقسمة عبر الأنابيب للسماح للمطورين بنشر نماذج صور مفتوحة دون إدارة الأجهزة بأنفسهم.
يدعم Hugging Face Diffusers الآن تحميل نقاط تفتيش Nunchaku Lite بشكل أصلي عبر `from_pretrained()`، مما يلغي الحاجة إلى محرك استدلال منفصل أو ترجمة CUDA محلية. تستفيد هذه التكاملات من طريقة SVDQuant لتشغيل طبقات المحوّل بأوزان وتنشيطات بدقة 4 بت (W4A4)، مما يقلل بشكل كبير من استخدام الذاكرة مع تحسين سرعة الاستدلال.
أطلقت مايكروسوفت Mage-Flow، وهي مجموعة توليدية مدمجة بحجم 4B مصممة للتوليد الفعال للنصوص إلى صور وتحرير الصور بناءً على التعليمات. يحقق النظام جودة تنافسية مع الحالة السائدة من خلال التصميم المشترك لمُرمِّز خفيف الوزن يُدعى Mage-VAE ومحول الانتشار متعدد الوسائط بدقة أصلية (NR-MMDiT).
قامت NVIDIA وHugging Face بدمج NVIDIA NeMo Automodel مع مكتبة 🤗 Diffusers لتوفير تدريب موزع من الدرجة الإنتاجية لنماذج الانتشار مفتوحة المصدر. يتيح هذا التعاون للمستخدمين ضبط أي نموذج بتنسيق Diffusers على Hugging Face Hub دون الحاجة إلى تحويل نقاط التفتيش أو إعادة كتابة كود النموذج.
يسأل مستخدم على منتدى مناقشة Hugging Face المجتمع عن تحديد الوسم المحدد للفنان المستخدم لـ "الشكل B" في صورة مقارنة منشورة بواسطة toyxyz.