الموضوع · Video generation
lab OpenAI News · منذ 9 يوم · 22 مشاهدة

تستخدم Higgsfield AI نموذج GPT-6 Astra لإطلاق ميزات فيديو جديدة في يوم واحد

قامت Higgsfield AI بدمج نموذج OpenAI GPT-6 Astra لتسريع سير عمل التطوير الداخلي وتعزيز منصة إنشاء إعلانات الفيديو. وتبلغ الشركة أن النموذج يمكّن مهندساً واحداً من تسليم ميزات استكشافية جديدة في يوم واحد فقط.

lab NVIDIA Research · منذ 16 يوم · 20 مشاهدة

FastGen-PDD تقدم التلخيص بالتفريغ المتوازي لتوليد الفيديو والصور بسرعة

يقدم الباحثون التفريغ بالتفريغ المتوازي (PDD)، وهي طريقة مبسطة تعتمد على المسارات لتسريع الاستدلال في نماذج الانتشار ومطابقة التدفق. وعلى عكس الأساليب الحالية التي تعتمد على تفريغ الدرجات التبايني الصعب التحسين والخسائر التنافسية، يتنبأ PDD بعدة خطوات إزالة الضوضاء لكل تقييم للشبكة.

media TLDR AI · منذ 26 يوم ARC-AGI 3 · 62.7% · 63 مشاهدة

إنفيديا تستحوذ على Hugging Face؛ أوبن إيه آي تطلق GPT-6 Astra؛ مايكروسوفت تطلق MAI-Transcribe-2

في أوائل سبتمبر 2026، أكدت إنفيديا استحواذها على Hugging Face بمبلغ 12.93 مليار دولار، بينما أطلقت أوبن إيه آي GPT-6 Astra وأطلقت مايكروسوفت نموذج التعرف على الكلام MAI-Transcribe-2.

media MarkTechPost · منذ 7 ساعة

باحثو إنفيديا يُصدرون Physis-Lang لتحسين الاستدلال الفيزيائي في نماذج الفيديو Cosmos 3

قدّم باحثون من إنفيديا ومعهد ماساتشوستس للتكنولوجيا وجامعة أكسفورد إطار عمل Physis-Lang، الذي يعزز نماذج العالم المرئي من خلال دمج لغة فيزيائية تتطور ذاتياً في التسميات. يعامل هذا النهج اللغة الفيزيائية على أنها تمثيل قابل للتحسين يُستخدم لتنقية البيانات، وتدريب النموذج، والاستدلال لتصحيح الأخطاء الفيزيائية في الفيديوهات المُولَّدة.

media MarkTechPost · منذ 3 يوم · 11 مشاهدة

أبحاث جوجل تقدم 4 أطر عمل وكيلة لتوليد فيديو متماسك يستمر لدقائق

أعلنت أبحاث جوجل عن مساعد مخرج بالذكاء الاصطناعي للفيديو، يتكون من أربعة أطر عمل وكيلة مصممة لتوليد فيديوهات متماسكة تمتد لدقائق من خلال معالجة انحراف الهوية والأخطاء المتتالية الشائعة في خطوط الأنابيب متعددة اللقطات. يعمل النظام كطبقة تنسيق محايدة للنماذج فوق Gemini وVeo، مع استخدام ختم SynthID للمخرجات.

media Latent Space · منذ 6 يوم · 11 مشاهدة

Runway تطرح WorldPrompt لتوليد عالم تفاعلي في الزمن الحقيقي

أطلقت Runway نموذج GWM Worlds 2، وهو نسخة تجريبية بحثية تحول توليد الفيديو والصوت عالي الدقة إلى محاكاة تفاعلية في الزمن الحقيقي باستخدام نموذج انتشار ذاتي الانحدار. تتضمن الإصدار WorldPrompt، وهو تنسيق إدخال جديد يسمح للمستخدمين بتحديد العوالم والأفعال المُولَّدة عن طريق تثبيت جوانب البيئة وإنشاء أحداث زمنية.

arxiv arXiv cs.AI · منذ 8 يوم · 17 مشاهدة

VideoX-Qwen يقدم إطار عمل يركز على البيانات لتحرير الفيديو القائم على التعليمات

يقدم الباحثون VideoX-Qwen، وهو إطار عمل متكامل يجمع بين بناء البيانات القابلة للتوسع مع تدريب النموذج لتعزيز تحرير الفيديو العام المدعوم بالتعليمات. يستخدم النظام خط أنابيب إنتاج ينظم نماذج متخصصة لتسجيلات التحرير الاتجاهية، مما يؤدي إلى أكثر من 1.2 مليون عينة عالية الجودة في مهام الإضافة والحذف والاستبدال والسمات.

media Hugging Face Forums · منذ 17 يوم · 26 مشاهدة

يتيح NanoAvatar أفاتارات تتحدث محليًا على أندرويد عبر Qualcomm QNN

NanoAvatar هو مشروع مفتوح المصدر يشغل أفاتارات تتحدث بشكل واقعي محليًا على هواتف أندرويد القديمة دون الحاجة إلى GPU سحابي. يتضمن الإصدار الكود العام وأوزان النموذج وملفات APK لأندرويد التي تجمع بين النموذج وأفاتار للاستخدام دون اتصال مع صوت المستخدم الخاص.

arxiv arXiv cs.LG · منذ 20 يوم · 34 مشاهدة

Vidu S2 يقدم نماذج أفتار تفاعلية في الوقت الفعلي وتحرير

يتكون Vidu S2 من Vidu S2-Avatar، وهو نموذج لشخصية رقمية تفاعلية في الوقت الفعلي، وVidu S2-Editing، وهو نموذج لتحرير الفيديو في الوقت الفعلي. يستكشف النظام أيضًا جدوى توليد الفيديو المكاني في الوقت الفعلي لكلا المكونين.