invideo تحسن تصحيح الألوان 3 مرات باستخدام GPT-6 Astra
تستخدم invideo نموذج GPT-6 Astra لتعزيز قدراتها في تحرير الفيديو الوكيلية، محققة زيادة ثلاثية في معدلات نجاح تصحيح الألوان وإنتاج 50 تأثيرًا مخصصًا في يوم واحد.
تستخدم invideo نموذج GPT-6 Astra لتعزيز قدراتها في تحرير الفيديو الوكيلية، محققة زيادة ثلاثية في معدلات نجاح تصحيح الألوان وإنتاج 50 تأثيرًا مخصصًا في يوم واحد.
قامت Higgsfield AI بدمج نموذج OpenAI GPT-6 Astra لتسريع سير عمل التطوير الداخلي وتعزيز منصة إنشاء إعلانات الفيديو. وتبلغ الشركة أن النموذج يمكّن مهندساً واحداً من تسليم ميزات استكشافية جديدة في يوم واحد فقط.
يقدم الباحثون التفريغ بالتفريغ المتوازي (PDD)، وهي طريقة مبسطة تعتمد على المسارات لتسريع الاستدلال في نماذج الانتشار ومطابقة التدفق. وعلى عكس الأساليب الحالية التي تعتمد على تفريغ الدرجات التبايني الصعب التحسين والخسائر التنافسية، يتنبأ PDD بعدة خطوات إزالة الضوضاء لكل تقييم للشبكة.
في أوائل سبتمبر 2026، أكدت إنفيديا استحواذها على Hugging Face بمبلغ 12.93 مليار دولار، بينما أطلقت أوبن إيه آي GPT-6 Astra وأطلقت مايكروسوفت نموذج التعرف على الكلام MAI-Transcribe-2.
قدّم باحثون من إنفيديا ومعهد ماساتشوستس للتكنولوجيا وجامعة أكسفورد إطار عمل Physis-Lang، الذي يعزز نماذج العالم المرئي من خلال دمج لغة فيزيائية تتطور ذاتياً في التسميات. يعامل هذا النهج اللغة الفيزيائية على أنها تمثيل قابل للتحسين يُستخدم لتنقية البيانات، وتدريب النموذج، والاستدلال لتصحيح الأخطاء الفيزيائية في الفيديوهات المُولَّدة.
أعلنت أبحاث جوجل عن مساعد مخرج بالذكاء الاصطناعي للفيديو، يتكون من أربعة أطر عمل وكيلة مصممة لتوليد فيديوهات متماسكة تمتد لدقائق من خلال معالجة انحراف الهوية والأخطاء المتتالية الشائعة في خطوط الأنابيب متعددة اللقطات. يعمل النظام كطبقة تنسيق محايدة للنماذج فوق Gemini وVeo، مع استخدام ختم SynthID للمخرجات.
أطلقت Runway نموذج GWM Worlds 2، وهو نسخة تجريبية بحثية تحول توليد الفيديو والصوت عالي الدقة إلى محاكاة تفاعلية في الزمن الحقيقي باستخدام نموذج انتشار ذاتي الانحدار. تتضمن الإصدار WorldPrompt، وهو تنسيق إدخال جديد يسمح للمستخدمين بتحديد العوالم والأفعال المُولَّدة عن طريق تثبيت جوانب البيئة وإنشاء أحداث زمنية.
يقدم الباحثون VideoX-Qwen، وهو إطار عمل متكامل يجمع بين بناء البيانات القابلة للتوسع مع تدريب النموذج لتعزيز تحرير الفيديو العام المدعوم بالتعليمات. يستخدم النظام خط أنابيب إنتاج ينظم نماذج متخصصة لتسجيلات التحرير الاتجاهية، مما يؤدي إلى أكثر من 1.2 مليون عينة عالية الجودة في مهام الإضافة والحذف والاستبدال والسمات.
NanoAvatar هو مشروع مفتوح المصدر يشغل أفاتارات تتحدث بشكل واقعي محليًا على هواتف أندرويد القديمة دون الحاجة إلى GPU سحابي. يتضمن الإصدار الكود العام وأوزان النموذج وملفات APK لأندرويد التي تجمع بين النموذج وأفاتار للاستخدام دون اتصال مع صوت المستخدم الخاص.
يتكون Vidu S2 من Vidu S2-Avatar، وهو نموذج لشخصية رقمية تفاعلية في الوقت الفعلي، وVidu S2-Editing، وهو نموذج لتحرير الفيديو في الوقت الفعلي. يستكشف النظام أيضًا جدوى توليد الفيديو المكاني في الوقت الفعلي لكلا المكونين.
نشر مستخدم فيديو تم إنشاؤه باستخدام نموذج DeepSeek V4.1 Flash الذي أُصدر حديثًا لاختبار قدراته في تركيب الفيديو المتحرك.
قام مستخدم بتجربة Seedance 2.5 لإنشاء مقاطع فيديو مولدة بالذكاء الاصطناعي، باستخدام منصة واجهة برمجة تطبيقات AIide التي توفر الوصول إلى Seedance ونماذج أخرى.
قام مستخدم باختبار نموذج توليد الفيديو Seedance 2.5 باستخدام تسلسل قصير للأزياء والمحرر يتميز بشخصية واحدة بملابس وتكوينات وأنماط بصرية مختلفة.