Video generation
media AI News (smol.ai) · منذ 4 يوم · مشاهدتان

Qwen وNVIDIA وMistral وBlack Forest Labs تطلق نماذج جديدة؛ التركيز يتجه نحو التوجيه والسلامة

تغطي جولة أخبار الذكاء الاصطناعي هذه للأيام 3-4 من أغسطس 2026، إصدارات نماذج مهمة من Alibaba Qwen وNVIDIA وMistral AI وBlack Forest Labs، إلى جانب تطورات في توجيه الوكلاء والبنية التحتية والأمن السيبراني.

media MarkTechPost · منذ 8 يوم · 15 مشاهدة

مينيماكس تطلق MiniMax H3، نموذج فيديو متعدد الحواس يولد مقاطع بدقة 2K مع صوت ستيريو أصلي

أطلقت مينيماكس MiniMax H3، وهو نموذج توليد متعدد الوسائط للأغراض العامة يدمج النص والصورة والفيديو والصوت في سياق واحد لإنتاج مقاطع فيديو بدقة 2K تصل مدتها إلى 15 ثانية مع صوت ستيريو أصلي. وعلى عكس المجموعات السابقة التي تعتمد على نماذج خبراء منفصلة لمهام محددة، يتيح H3 للمستخدمين التعبير عن علاقات المرجعية والتحرير من خلال مطالبات باللغة الطبيعية.

lab xAI News · منذ 8 يوم · 5 مشاهدات

xAI تضيف مراجع الصور والصوت إلى Imagine Video 1.5

قامت xAI بتحديث نموذج Imagine Video 1.5 لدعم المراجع النصية والصور والصوت، مما يتيح للمستخدمين إنشاء مقاطع فيديو بدقة تصل إلى 1080p. يسمح التحديث بثبات الشخصيات عن طريق قفل الوجوه والأصوات عبر المشاهد، مع دعم ما يصل إلى سبع مراجعات لكل عملية توليد.

media r/LocalLLaMA · منذ 9 يوم · 6 مشاهدات

مينيماكس تطلق نموذج الفيديو MiniMax H3 بأوزان مفتوحة قريباً

أطلقت مينimax نموذج MiniMax H3، وهو نموذج توليد متعدد الوسائط للأغراض العامة يفهم السياق الموحد عبر النص والصور والفيديو والصوت. يولد النموذج فيديو بصوت ستيريو أصلي لمدة تصل إلى 15 ثانية ودقة 2K.

lab Hugging Face Blog · منذ 13 يوم · 19 مشاهدة

إنفيديا تطرح Cosmos-H-Dreams، محاكٍ مولّد للوقت الحقيقي للجراحة الروبوتية

أعلنت إنفيديا عن إطلاق Cosmos-H-Dreams، وهو محاكٍ مولّد يعمل في الوقت الفعلي ومشروط بالإجراءات للجراحة الروبوتية، يستخلص قدرات نموذج Cosmos-H-Surgical-Simulator الخاص بها ليحوّلها إلى نموذج طالب سببي. يُقدّم النظام عبر مكتبة إنفيديا FlashDreams المُسرّعة للاستنتاج بالتدفق، مما يتيح التحكم التفاعلي من قبل شخص أو سياسة مُتعلَّمة في حلقة مغلقة.

media MarkTechPost · منذ 13 يوم · مشاهدة واحدة

Black Forest Labs تطلق FLUX 3، نموذج تدفق متعدد الوسائط للتنبؤ بالصور والفيديو والصوت وحركات الروبوت

أطلقت Black Forest Labs FLUX 3، وهو نموذج أساسي متعدد الوسائط يتعلم من الصور ومقاطع الفيديو والصوت ضمن بنية واحدة. إنه أول نموذج FLUX يُصدر التنبؤ بالفيديو والصوت والحركة من مجموعة واحدة من الأوزان.

media Latent Space · منذ 16 يوم · 4 مشاهدات

Black Forest Labs تطلق نماذج التدفق متعددة الوسائط FLUX 3 ونموذج الروبوتات FLUX-mimic

أطلقت Black Forest Labs نموذج FLUX 3، وهو عائلة من نماذج التدفق متعددة الوسائط تتضمن قدرات توليد الفيديو مع الصوت الأصلي. يتضمن الإصدار أيضًا FLUX-mimic، وهو متغير مصمم لتطبيقات الروبوتات الخاصة بحركة الفيديو.

lab Hugging Face Blog · منذ 23 يوم · 5 مشاهدات

تمكين NVIDIA NeMo Automodel من ضبط نموذج الانتشار الموزع مع Hugging Face Diffusers

قامت NVIDIA وHugging Face بدمج NVIDIA NeMo Automodel مع مكتبة 🤗 Diffusers لتوفير تدريب موزع من الدرجة الإنتاجية لنماذج الانتشار مفتوحة المصدر. يتيح هذا التعاون للمستخدمين ضبط أي نموذج بتنسيق Diffusers على Hugging Face Hub دون الحاجة إلى تحويل نقاط التفتيش أو إعادة كتابة كود النموذج.

lab Google — The Keyword (AI) · منذ 23 يوم · 6 مشاهدات

جوجل تضيف Gemini Omni وأفاتار شخصية إلى Google Vids

أطلقت جوجل تحديثين جديدين لـ Google Vids: دمج Gemini Omni لتوليد وتحرير الفيديو القائم على النص، وميزة تسمح للمستخدمين بإنشاء أفاتارات رقمية شخصية. تهدف هذه الأدوات إلى تبسيط إنشاء الفيديو من خلال تمكين المستخدمين من توليد مقاطع من مطالبات اللغة الطبيعية وإشارات الصور، وكذلك الظهور في الفيديوهات دون الحاجة للتصوير الفعلي.

lab NVIDIA Technical Blog · منذ 24 يوم

إنفيديا تناقش دمج وكلاء الذكاء الاصطناعي المرادعين للسياق في سير العمل المؤسسي

يجب دمج وكيل تحليل الفيديو المدعوم بالذكاء الاصطناعي القادر على الإدراك والاستدعاء والتصرف في كميات هائلة من لقطات الفيديو مع سير العمل الحالي ليصبح مفيدًا. وتشمل هذه سير العمل أنظمة إدارة المحتوى، ومنصات المراسلة، وقواعد البيانات، وطوابير التذاكر، ومسارات التصعيد.

arxiv arXiv cs.CL · منذ 24 يوم

Text2Sign: خط أساس للانتشار على وحدة معالجة رسومات واحدة لتوليد مقاطع لغة الإشارة من النص

يقدم الباحثون Text2Sign، وهو نموذج انتشار مشروط بالنص مصمم لتوليد مقاطع قصيرة من لغة الإشارة على وحدة معالجة رسومات NVIDIA L4 واحدة، مما يعالج التكاليف المرتفعة المرتبطة بتدريب وتقييم نماذج الانتشار المرئية. يجمع النظام بين مُشفّر نصي للرؤية واللغة مجمّد مع مُشفّر-مُفكّك ثلاثي الأبعاد وانتباه مكاني-زمني مُفكّك لتقليل المتطلبات الحسابية مع الحفاظ على تماسك الحركة.

lab NVIDIA Technical Blog · منذ 24 يوم

NVIDIA DeepStream 9.1 يتيح التتبع ثلاثي الأبعاد متعدد الكاميرات

يجب على المطورين الذين يبنيون تطبيقات تحليل الفيديو عبر مساحات كبيرة تتبع نفس الكائن أثناء انتقاله بين مشاهد الكاميرا. يفتقر التتبع ثنائي الأبعاد بكاميرا واحدة إلى معلومات عمق موثوقة ويفقد عادةً تتبع الكائن عندما يغادر الإطار، مما يحد من التطبيقات مثل سلامة المستودعات وتحليل التجزئة ومراقبة المباني الذكية.

arxiv arXiv cs.LG · منذ 25 يوم

فجوات التسلسل في نماذج الانتشار المرئي

يحدد الباحثون "فجوة التسلسل" في نماذج الانتشار المرئي، حيث تتدهور الأداء مع طول سلاسل السببية أثناء محاكاة ديناميكيات الكرات الصلبة متعددة الكرات. تظهر التجارب الخاضعة للرقابة أن هذا التدهور ناتج عن هياكل الأحداث المعتمدة بدلاً من طول الفيديو، حيث يختفي في ضوابط الكرة الواحدة بدون تفاعلات.

media r/LocalLLaMA · منذ 26 يوم · مشاهدة واحدة

Wan-Dancer يولد مقاطع فيديو رقص متسقة مدتها دقائق متزامنة مع الموسيقى

قدم الباحثون Wan-Dancer، وهو إطار عمل هرمي يولد مقاطع فيديو رقص طويلة وعالية الدقة متزامنة مع الموسيقى. يتغلب النظام على القيود النموذجية البالغة 20 ثانية لنماذج الانتشار من خلال فصل التوليد إلى تخطيط الإطاح الرئيسية العالمية والتحسين الزمني المحلي.

media r/LocalLLaMA · منذ 30 يوم

المطور يطلق لعبة مجانية 'Simulation Simulator' مع شخصية غير لاعبة (NPC) تعتمد على نموذج لغوي كبير محلي

أطلق المطور MorphLand عنوان Steam المجاني المسمى "Simulation Simulator"، والذي يدمج نموذجًا لغويًا كبيرًا محليًا ليعمل كشخصية غير لاعبة داخل اللعبة. اللعبة هي تجربة محادثة حرة حيث يحاول اللاعبون إقناع رفيقهم بالذكاء الاصطناعي بأن الواقع هو محاكاة.