OpenAI تطرح ChatGPT Images 2.5 بتفاصيل أدق، وتوليد أسرع، وأدوات تحرير جديدة
أطلقت OpenAI نموذج ChatGPT Images 2.5، وهو أحدث نموذج للصور يتميز بتفاصيل أكثر حدة، وقدرات تحرير أدق، وتوليد أسرع بنسبة تصل إلى 50% مقارنة بالإصدار السابق.
أطلقت OpenAI نموذج ChatGPT Images 2.5، وهو أحدث نموذج للصور يتميز بتفاصيل أكثر حدة، وقدرات تحرير أدق، وتوليد أسرع بنسبة تصل إلى 50% مقارنة بالإصدار السابق.
بالتعاون مع المخرجة ليز غاربوس وبريمورديال سوب، استخدمت جوجل ديب مايند نماذج ذكاء اصطناعي توليدية لإعادة بناء لقاء غير مصور بين بيرت وإثيل شاتز للفيديو الوثائقي القصير "Love, Rendered". يتناول المشروع التدهور المعرفي من خلال إعادة إنشاء ذكرى محددة كانت موجودة فقط في عقل الزوجين.
تقوم جوجل بإطلاق Google Pics، وهو أداة لإنشاء وتحرير الصور مبنية على نموذج Nano Banana، لجميع مشتركي Google AI Pro و Ultra ومعظم عملاء Workspace التجاريين خلال الأسابيع القادمة.
يقترح الباحثون AutoRef، وهي طريقة تحسن تلقائيًا إطار التنفيذ لتوليد الصور متعددة المراجع باستخدام الوكلاء مع الحفاظ على النماذج الأساسية مجمدة. يعيد وكيل البرمجة كتابة كود الإطار بشكل تكراري لمعالجة تحديات مثل حذف الموضوعات والتكوين غير الطبيعي.
نشر هنغ تران، وهو طالب ماجستير في جامعة تكنولوجيا المعلومات (VNU-HCM)، الكود والبيانات الخاصة ببحثه بعنوان "فخ القص: وضع فشل صامت في مشفرات الصور العصبية المفرطة في التخصيص". يسلط العمل الضوء على كيفية قدرة المشفرات المفرطة في التخصيص مثل Cool-chic وC3 على إنتاج صور ذات ألوان مسطحة مع تدرجات تشويه تساوي صفراً لأنواع محددة من المحتوى.
يغطي هذا التحديث عدة تطورات في مشهد الذكاء الاصطناعي، بما في ذلك فتح ميتا لمنصتها Muse أمام مطوري الطرف الثالث، وإصدار إصدار جديد من نموذج التقسيم الخاص بها، وحادث أمني يتعلق بـ Gemini من جوجل.
أطلقت فريق كوين التابع لألبابا نموذج كوين-إيميج 2.1، وهو نموذج موحد لتوليد الصور من النص وتحريرها، يدمج نقاط التفتيش المنفصلة السابقة في محوّل انتشار واحد بـ 7 مليار معلمة.
أطلقت Qwen نموذج Qwen-Image-2.1، وهو نموذج موحد مصمم لكل من توليد الصور وتحريرها.
أطلقت باداراموني محولًا جديدًا لنموذج Krea-2-Turbo يجمع بين حزم الواقعية العامة بتنسيقات مختلفة في ملف واحد. يعالج الإصدار القيود حيث تفشل أدوات الدمج القياسية في دمج محولات LoRA و LoKR الكلاسيكية لأنها لا تشارك نفس تنسيق الرتبة المنخفضة.
Diffusers-workflow هو محرك إعلاني مبني فوق Hugging Face Diffuers يتيح لوكلاء نماذج اللغة الكبيرة تأليف، والتحقق، وتشغيل، وفحص خطوط أنابيب الصور أو الفيديو باستخدام مستندات JSON بدلاً من نصوص Python. ويعرض خادم MCP مع حوالي 50 أداة كواجهة رئيسية، مما يتيح التحكم غير المراقب للوكلاء في موارد وحدة معالجة الرسومات.
أصدرت Gradio مشروع Workflow1111، الذي يعيد بناء معظم مجموعة ميزات stable-diffusion-webui الخاصة بـ AUTOMATIC1111 باستخدام إطار عمل gr.Workflow. يتكون التطبيق من لوحة واحدة تحتوي على اثني عشر خط أنابيب وسطي مبنيًا من ثلاثة وسبعين عقدة، تغطي مهام تحويل النص إلى صورة، والصورة إلى فيديو، ومختلف مهام المعالجة المسبقة.
قام مستخدم بنشر الكود والأوزان لتشغيل نموذج Cosmos3 الخاص بشركة NVIDIA الذي يحتوي على 64 مليار معلمة محليًا باستخدام التكمية INT4. تدعم التنفيذ مهام النص إلى صورة والصورة إلى الفيديو على Apple Silicon عبر MLX وكذلك CUDA.
أطلقت OpenAI تحديث ChatGPT Images 2.5 لنماذج توليد الصور الخاصة بها، والذي يعزز القدرة على اتباع التعليمات عبر دورات متعددة ويزيد من سرعة الاستجابة. الإصدار الجديد أفضل أيضًا في الحفاظ على العناصر من الصور المرجعية التي يقدمها المستخدمون.
قام مهندس بفتح مصدر نسخة طبق الأصل من مشروع سوريا ناريدي الفيروسي، الذي يدرب نموذج برمجة على رسم ألوان مائية باستخدام جافاسكريبت والتعلم المعزز. تستخدم التنفيذ مكتبة TRL وOpenEnv لإنشاء خط أنابيب متكامل على Hugging Face للتدريب والتقييم والاستنتاج.