الموضوع · Video generation
lab xAI News · منذ 14 يوم · 11 مشاهدة

xAI تضيف مراجع الصور والصوت إلى Imagine Video 1.5

قامت xAI بتحديث نموذج Imagine Video 1.5 لدعم المراجع النصية والصور والصوت، مما يتيح للمستخدمين إنشاء مقاطع فيديو بدقة تصل إلى 1080p. يسمح التحديث بثبات الشخصيات عن طريق قفل الوجوه والأصوات عبر المشاهد، مع دعم ما يصل إلى سبع مراجعات لكل عملية توليد.

lab Google — The Keyword (AI) · منذ 29 يوم · 7 مشاهدات

جوجل تضيف Gemini Omni وأفاتار شخصية إلى Google Vids

أطلقت جوجل تحديثين جديدين لـ Google Vids: دمج Gemini Omni لتوليد وتحرير الفيديو القائم على النص، وميزة تسمح للمستخدمين بإنشاء أفاتارات رقمية شخصية. تهدف هذه الأدوات إلى تبسيط إنشاء الفيديو من خلال تمكين المستخدمين من توليد مقاطع من مطالبات اللغة الطبيعية وإشارات الصور، وكذلك الظهور في الفيديوهات دون الحاجة للتصوير الفعلي.

lab NVIDIA Research · منذ 5 ساعة · مشاهدة واحدة

يستخدم HorizonRelight التكييف الذاتي المقنع لإعادة الإضاءة المتسقة للفيديو طويل المدى

يتناول الباحثون الانقطاعات الزمنية في إعادة إضاءة الفيديو طويل المدى عن طريق إعادة صياغة المهمة على أنها ترجمة مجال كامن مشروط زمنيًا. يفرض الإطار استمرارية عبر القطع عن طريق نشر كميات المجال المستهدف عبر الحدود ويستخدم التكييف الذاتي المقنع للمجال المستهدف لجعل هذا السلوك قابلاً للتعلم.

media MarkTechPost · منذ 3 يوم · 7 مشاهدات

LTX تطلق LTX-2.5، نموذج عالمي بأوزان مفتوحة لتوليد الفيديو محلياً

أطلقت LTX الإصدار LTX-2.5، وهو نموذج عالمي بأوزان مفتوحة لتوليد الفيديو، والتطبيقات في الوقت الفعلي، والذكاء الاصطناعي الفيزيائي، ومُحسّن للاستدلال المحلي على وحدات معالجة الرسومات NVIDIA RTX وأجهزة DGX Spark. يهدف هذا الإصدار إلى نقل إنتاج الفيديو من البنية التحتية السحابية إلى أجهزة سطح المكتب المحلية من خلال تقليل متطلبات ذاكرة الفيديو (VRAM) وإزالة رسوم كل توليد.

media r/LocalLLaMA · منذ 5 يوم · 11 مشاهدة

MiniMax تطلق نموذج فيديو H3 بوزن مفتوح مع صوت متزامن

أطلقت MiniMax نموذج MiniMax H3، وهو نموذج متعدد الوسائط لتوليد الفيديو بوزن مفتوح قادر على معالجة النص والصور ومقاطع الفيديو والصوت. يقوم النموذج بتوليد الصور والصوت المجسم المتزامن بشكل مشترك، بما في ذلك الحوارات والمؤثرات الصوتية والأجواء والموسيقى، بدلاً من إضافة الصوت كخطوة ما بعد المعالجة.

media r/LocalLLaMA · منذ 5 يوم · 9 مشاهدات

مينيماكس تطلق نموذج توليد الفيديو H3 بوزن مفتوح مع صوت ستيريو أصلي

أطلقت مينيماكس نموذج توليد الفيديو الشامل H3 ذو الأوزان المفتوحة على Hugging Face، والذي يتميز بصوت ستيريو أصلي يمكنه تشغيل الفيديو في تمرير أمامي واحد. يدعم النموذج دقة 2K بمعدل 24 إطارًا في الثانية للقطات التي تتراوح مدتها من 5 إلى 15 ثانية ويقبل ما يصل إلى تسع صور مرجعية وثلاثة مقاطع فيديو وثلاثة مقاطع صوتية لكل عملية توليد.

media AI News (smol.ai) · منذ 10 يوم · مشاهدتان

Qwen وNVIDIA وMistral وBlack Forest Labs تطلق نماذج جديدة؛ التركيز يتجه نحو التوجيه والسلامة

تغطي جولة أخبار الذكاء الاصطناعي هذه للأيام 3-4 من أغسطس 2026، إصدارات نماذج مهمة من Alibaba Qwen وNVIDIA وMistral AI وBlack Forest Labs، إلى جانب تطورات في توجيه الوكلاء والبنية التحتية والأمن السيبراني.

media MarkTechPost · منذ 14 يوم · 17 مشاهدة

مينيماكس تطلق MiniMax H3، نموذج فيديو متعدد الحواس يولد مقاطع بدقة 2K مع صوت ستيريو أصلي

أطلقت مينيماكس MiniMax H3، وهو نموذج توليد متعدد الوسائط للأغراض العامة يدمج النص والصورة والفيديو والصوت في سياق واحد لإنتاج مقاطع فيديو بدقة 2K تصل مدتها إلى 15 ثانية مع صوت ستيريو أصلي. وعلى عكس المجموعات السابقة التي تعتمد على نماذج خبراء منفصلة لمهام محددة، يتيح H3 للمستخدمين التعبير عن علاقات المرجعية والتحرير من خلال مطالبات باللغة الطبيعية.

media r/LocalLLaMA · منذ 15 يوم · 9 مشاهدات

مينيماكس تطلق نموذج الفيديو MiniMax H3 بأوزان مفتوحة قريباً

أطلقت مينimax نموذج MiniMax H3، وهو نموذج توليد متعدد الوسائط للأغراض العامة يفهم السياق الموحد عبر النص والصور والفيديو والصوت. يولد النموذج فيديو بصوت ستيريو أصلي لمدة تصل إلى 15 ثانية ودقة 2K.

lab Hugging Face Blog · منذ 19 يوم · 23 مشاهدة

إنفيديا تطرح Cosmos-H-Dreams، محاكٍ مولّد للوقت الحقيقي للجراحة الروبوتية

أعلنت إنفيديا عن إطلاق Cosmos-H-Dreams، وهو محاكٍ مولّد يعمل في الوقت الفعلي ومشروط بالإجراءات للجراحة الروبوتية، يستخلص قدرات نموذج Cosmos-H-Surgical-Simulator الخاص بها ليحوّلها إلى نموذج طالب سببي. يُقدّم النظام عبر مكتبة إنفيديا FlashDreams المُسرّعة للاستنتاج بالتدفق، مما يتيح التحكم التفاعلي من قبل شخص أو سياسة مُتعلَّمة في حلقة مغلقة.

media MarkTechPost · منذ 19 يوم · مشاهدة واحدة

Black Forest Labs تطلق FLUX 3، نموذج تدفق متعدد الوسائط للتنبؤ بالصور والفيديو والصوت وحركات الروبوت

أطلقت Black Forest Labs FLUX 3، وهو نموذج أساسي متعدد الوسائط يتعلم من الصور ومقاطع الفيديو والصوت ضمن بنية واحدة. إنه أول نموذج FLUX يُصدر التنبؤ بالفيديو والصوت والحركة من مجموعة واحدة من الأوزان.

media Latent Space · منذ 22 يوم · 8 مشاهدات

Black Forest Labs تطلق نماذج التدفق متعددة الوسائط FLUX 3 ونموذج الروبوتات FLUX-mimic

أطلقت Black Forest Labs نموذج FLUX 3، وهو عائلة من نماذج التدفق متعددة الوسائط تتضمن قدرات توليد الفيديو مع الصوت الأصلي. يتضمن الإصدار أيضًا FLUX-mimic، وهو متغير مصمم لتطبيقات الروبوتات الخاصة بحركة الفيديو.

lab Hugging Face Blog · منذ 28 يوم · 5 مشاهدات

تمكين NVIDIA NeMo Automodel من ضبط نموذج الانتشار الموزع مع Hugging Face Diffusers

قامت NVIDIA وHugging Face بدمج NVIDIA NeMo Automodel مع مكتبة 🤗 Diffusers لتوفير تدريب موزع من الدرجة الإنتاجية لنماذج الانتشار مفتوحة المصدر. يتيح هذا التعاون للمستخدمين ضبط أي نموذج بتنسيق Diffusers على Hugging Face Hub دون الحاجة إلى تحويل نقاط التفتيش أو إعادة كتابة كود النموذج.

lab NVIDIA Technical Blog · منذ 29 يوم · مشاهدة واحدة

إنفيديا تناقش دمج وكلاء الذكاء الاصطناعي المرادعين للسياق في سير العمل المؤسسي

يجب دمج وكيل تحليل الفيديو المدعوم بالذكاء الاصطناعي القادر على الإدراك والاستدعاء والتصرف في كميات هائلة من لقطات الفيديو مع سير العمل الحالي ليصبح مفيدًا. وتشمل هذه سير العمل أنظمة إدارة المحتوى، ومنصات المراسلة، وقواعد البيانات، وطوابير التذاكر، ومسارات التصعيد.