Video generation
arxiv arXiv cs.AI · منذ 5 ساعة · 10 مشاهدات

VideoX-Qwen يقدم إطار عمل يركز على البيانات لتحرير الفيديو القائم على التعليمات

يقدم الباحثون VideoX-Qwen، وهو إطار عمل متكامل يجمع بين بناء البيانات القابلة للتوسع مع تدريب النموذج لتعزيز تحرير الفيديو العام المدعوم بالتعليمات. يستخدم النظام خط أنابيب إنتاج ينظم نماذج متخصصة لتسجيلات التحرير الاتجاهية، مما يؤدي إلى أكثر من 1.2 مليون عينة عالية الجودة في مهام الإضافة والحذف والاستبدال والسمات.

lab OpenAI News · منذ 2 يوم · 17 مشاهدة

تستخدم Higgsfield AI نموذج GPT-6 Astra لإطلاق ميزات فيديو جديدة في يوم واحد

قامت Higgsfield AI بدمج نموذج OpenAI GPT-6 Astra لتسريع سير عمل التطوير الداخلي وتعزيز منصة إنشاء إعلانات الفيديو. وتبلغ الشركة أن النموذج يمكّن مهندساً واحداً من تسليم ميزات استكشافية جديدة في يوم واحد فقط.

lab NVIDIA Research · منذ 8 يوم · 15 مشاهدة

FastGen-PDD تقدم التلخيص بالتفريغ المتوازي لتوليد الفيديو والصور بسرعة

يقدم الباحثون التفريغ بالتفريغ المتوازي (PDD)، وهي طريقة مبسطة تعتمد على المسارات لتسريع الاستدلال في نماذج الانتشار ومطابقة التدفق. وعلى عكس الأساليب الحالية التي تعتمد على تفريغ الدرجات التبايني الصعب التحسين والخسائر التنافسية، يتنبأ PDD بعدة خطوات إزالة الضوضاء لكل تقييم للشبكة.

media Hugging Face Forums · منذ 10 يوم · 20 مشاهدة

يتيح NanoAvatar أفاتارات تتحدث محليًا على أندرويد عبر Qualcomm QNN

NanoAvatar هو مشروع مفتوح المصدر يشغل أفاتارات تتحدث بشكل واقعي محليًا على هواتف أندرويد القديمة دون الحاجة إلى GPU سحابي. يتضمن الإصدار الكود العام وأوزان النموذج وملفات APK لأندرويد التي تجمع بين النموذج وأفاتار للاستخدام دون اتصال مع صوت المستخدم الخاص.

arxiv arXiv cs.LG · منذ 12 يوم · 29 مشاهدة

Vidu S2 يقدم نماذج أفتار تفاعلية في الوقت الفعلي وتحرير

يتكون Vidu S2 من Vidu S2-Avatar، وهو نموذج لشخصية رقمية تفاعلية في الوقت الفعلي، وVidu S2-Editing، وهو نموذج لتحرير الفيديو في الوقت الفعلي. يستكشف النظام أيضًا جدوى توليد الفيديو المكاني في الوقت الفعلي لكلا المكونين.

media TLDR AI · منذ 19 يوم ARC-AGI 3 · 62.7% · 54 مشاهدة

إنفيديا تستحوذ على Hugging Face؛ أوبن إيه آي تطلق GPT-6 Astra؛ مايكروسوفت تطلق MAI-Transcribe-2

في أوائل سبتمبر 2026، أكدت إنفيديا استحواذها على Hugging Face بمبلغ 12.93 مليار دولار، بينما أطلقت أوبن إيه آي GPT-6 Astra وأطلقت مايكروسوفت نموذج التعرف على الكلام MAI-Transcribe-2.

media MarkTechPost · منذ 25 يوم · 51 مشاهدة

جوجل تطلق جيميوني أومني 1.1 فلاش مع تمديد مشهد لمدة 40 ثانية ومسودات بدقة 360p

أطلقت جوجل جيميوني أومني 1.1 فلاش، وهو تحديث إنتاجي لنموذجها الأصلي لتوليد الفيديو متعدد الوسائط، والذي يحوّل التركيز من التوليد البسيط إلى التحرير القابل للتوجيه. يُدخل التحديث تفاعلات ذات حالة عبر واجهة برمجة التطبيقات Interactions API، مما يسمح للمستخدمين بتعديل الفيديوهات مع الحفاظ على السياق السابق دون إعادة تحميل الملفات.

media Hugging Face Forums · منذ 26 يوم · 39 مشاهدة

اختبار Seedance 2 يكشف عن نقاط القوة في حركة الكاميرا والجو العام

تسلط تقييمات نموذج توليد الفيديو بالذكاء الاصطناعي Seedance 2 الضوء على فهمه المحسّن للعناصر السينمائية مقارنة بالإصدارات السابقة. يُظهر الاختبار أنه بينما يتعامل النموذج بشكل جيد مع الاستمرارية البصرية والإضاءة، فإنه لا يزال يواجه صعوبات في اتساق العناصر المعقدة وتحميل الأوامر الزائد.

media Latent Space · منذ 26 يوم · 56 مشاهدة

OpenAI تستهدف AGI بحلول نهاية 2026؛ إطلاق روبوت Microduck

صرح كبير علماء OpenAI، جاكوب باتشوكي، بأن نموذج Astra غير المُطلق يهدف إلى أن يكون "متدرب أبحاث ذكاء اصطناعي آلي" بحلول سبتمبر 2026، بينما يقدر الرئيس التنفيذي سام ألتمان أن الشركة ستعلن عن تحقيق AGI داخلياً بحلول ديسمبر 2026.

lab Google DeepMind Blog · منذ 27 يوم · 63 مشاهدة

جوجل تطلق جيميوني أومني 1.1 فلاش مع تمديد المشهد وتحكمات الفيديو

أعلنت جوجل عن إطلاق جيميوني أومني 1.1 فلاش، وهي مجموعة جديدة من أدوات التحكم الإبداعي وقدرات توليد الفيديو المصممة لجعل النموذج جاهزاً للإنتاج للاستخدام المهني عبر واجهة برمجة التطبيقات جيميوني في استوديو جوجل للذكاء الاصطناعي.