xAI تطلق Imagine Image 2.0 بقدرات دقيقة للتعديل والتخطيط
أطلقت xAI Imagine Image 2.0 بشكل عام كوضع جودة جديد، وتطبيقات iOS وAndroid. يركز التحديث على توليد الصور بدقة عالية وتعديلها لسير العمل الإبداعي الاحترافي.
أطلقت xAI Imagine Image 2.0 بشكل عام كوضع جودة جديد، وتطبيقات iOS وAndroid. يركز التحديث على توليد الصور بدقة عالية وتعديلها لسير العمل الإبداعي الاحترافي.
تشير الاختبارات الأولية لنموذج DeepSeek v4 Flash إلى تحسن ملحوظ في مهارات تصميم واجهة المستخدم وتجربة المستخدم. وعلى الرغم من هذه التحسينات، يُشار إلى أن النموذج جائع للرموز (tokens).
يقدم الباحثون تكميم المتجه الموجه بالعناقيد (CGVQ)، وهي طريقة مصممة لتحسين أداء معدل التشويه في ضغط الصور القائم على البدع الغاوسية. يقسم النهج معاملات غاوس إلى مجموعات متجانسة قبل التكميم، مما يعالج عدم الكفاءة الناتجة عن تخزين أعداد كبيرة من معاملات النقطة العائمة لكل بدعة.
تختبر Kavram واجهة برمجة تطبيقات لتوليد الصور للإنتاج تستخدم شبكة GPU موزعة مقسمة عبر الأنابيب للسماح للمطورين بنشر نماذج صور مفتوحة دون إدارة الأجهزة بأنفسهم.
يدعم Hugging Face Diffusers الآن تحميل نقاط تفتيش Nunchaku Lite بشكل أصلي عبر `from_pretrained()`، مما يلغي الحاجة إلى محرك استدلال منفصل أو ترجمة CUDA محلية. تستفيد هذه التكاملات من طريقة SVDQuant لتشغيل طبقات المحوّل بأوزان وتنشيطات بدقة 4 بت (W4A4)، مما يقلل بشكل كبير من استخدام الذاكرة مع تحسين سرعة الاستدلال.
أطلقت مايكروسوفت Mage-Flow، وهي مجموعة توليدية مدمجة بحجم 4B مصممة للتوليد الفعال للنصوص إلى صور وتحرير الصور بناءً على التعليمات. يحقق النظام جودة تنافسية مع الحالة السائدة من خلال التصميم المشترك لمُرمِّز خفيف الوزن يُدعى Mage-VAE ومحول الانتشار متعدد الوسائط بدقة أصلية (NR-MMDiT).
أعلنت إنفيديا عن إطلاق CTRL-G (Controllable Generative Graphics for Games)، وهو إطار عمل مصمم لمعالجة تحدي التحكم في أنظمة الذكاء الاصطناعي التوليدي داخل بيئات الألعاب التفاعلية.
أطلقت جوجل ثلاثة نماذج جديدة: Gemini 3.6 Flash لأعباء عمل الوكالات العامة بكفاءة، و3.5 Flash-Lite للتطبيقات منخفضة زمن الوصول، ونموذج 3.5 Flash المتخصص في الأمن السيبراني والمدمج مع CodeMender.
يسأل مستخدم على منتدى مناقشة Hugging Face المجتمع عن تحديد الوسم المحدد للفنان المستخدم لـ "الشكل B" في صورة مقارنة منشورة بواسطة toyxyz.
قامت NVIDIA وHugging Face بدمج NVIDIA NeMo Automodel مع مكتبة 🤗 Diffusers لتوفير تدريب موزع من الدرجة الإنتاجية لنماذج الانتشار مفتوحة المصدر. يتيح هذا التعاون للمستخدمين ضبط أي نموذج بتنسيق Diffusers على Hugging Face Hub دون الحاجة إلى تحويل نقاط التفتيش أو إعادة كتابة كود النموذج.
يسأل مستخدم في منتديات Hugging Face عن التطوير المحتمل لإصدار ConvRot بكمّيّة INT8 أو FP8 لنموذج FireRed Image Edit v1.1.
يستعرض سيمون ويليسون كيفية إنشاء "حيوان أليف" متحرك مخصص لتطبيق سطح مكتب Codex من خلال الاستفادة من نموذج GPT-5.6 Sol الخاص بشركة OpenAI وواجهة برمجة التطبيقات gpt-image-2.
احتفالاً بمرور 25 عامًا على تأسيسها، تطلق Google واجهة جديدة قابلة للتصفح لـ Google Images جنبًا إلى جنب مع قدرات جديدة لتوليد الصور داخل AI Overviews.
يقدم المؤلفون إطار عمل CtrlVTON، الذي يعالج نقص تحكم المستخدم في التجربة الافتراضية عن طريق إعادة صياغة المهمة على أنها تعديل صور بقناع تقسيم على مستوى البكسل. يسمح هذا النهج للمستخدمين بتحديد حجم الملابس، والأسلوب، والموضع المكاني على الجسم.
يُظهر HoLo-FuSe أن ركيزة بايت HoLo Semantic Layer (HSL) المتجمدة وذات الصفر معلمة يمكنها بشكل فعال تكييف نموذج الانتشار لتوليد الصور. يختبر المشروع ما إذا كان إطار الميزات الحتمي ذو 27 بُعدًا هذا يمكن أن يعمل كآلية تكييف لـ DDPM المشروط بالفئة، مستبدلاً التضمينات المتعلمة التقليدية.
أكمل المطور ZimengXiong نقل نماذج Hunyuan3D-Paint وHunyuan3D-Shape إلى Swift-MLX وPython MLX، مما يتيح توليد الصور إلى ثلاثي الأبعاد محليًا على أجهزة Apple Silicon. يتم توزيع العمل كتطبيق سطح مكتب مفتوح المصدر Modelr لنظامي macOS وiOS، بالإضافة إلى الكود المصدري لدمج التقنية في تطبيقات Swift.
أطلقت Fabricio3t تطبيق Flaxeo Image، وهو واجهة مستخدم لسطح المكتب المحلي مبنية حول الإصدار الأخير من sd.cpp. تهدف التطبيق إلى كشف معظم قدرات الخلفية، بما في ذلك التوليد، والتحرير، ومسارات الفيديو، وإدارة النماذج، وخيارات الأجهزة.