أعلنت أبحاث جوجل عن مساعد مخرج بالذكاء الاصطناعي للفيديو، يتكون من أربعة أطر عمل وكيلة مصممة لتوليد فيديوهات متماسكة تمتد لدقائق من خلال معالجة انحراف الهوية والأخطاء المتتالية الشائعة في خطوط الأنابيب متعددة اللقطات. يعمل النظام كطبقة تنسيق محايدة للنماذج فوق Gemini وVeo، مع استخدام ختم SynthID للمخرجات.

تشمل المجموعة Co-Director، الذي يستخدم بحث الضيوط المتعددة للتخطيط الإبداعي؛ وCANVAS، الذي يوفر ذاكرة بصرية دائمة للحفاظ على اتساق الشخصيات والأشياء؛ وA²RD، وهو بنية لا تحتاج إلى تدريب لتوليد فيديو طويل قطعة بقطعة؛ وVQQA، الذي يستخدم تحسين الموجه المغلق عبر الإجابة على الأسئلة البصرية.

قامت جوجل بتقييم هذه الأطر باستخدام معايير جديدة تشمل GenAD-Bench وHardContinuityBench وLVBench-C. حقق Co-Director متوسط 81.4 على GenAD-Bench، بينما أظهر A²RD اتساقاً أفضل بنسبة تصل إلى 30% واتساقاً سردياً أفضل بنسبة 20% في الفيديوهات التي تتراوح بين دقيقة واحدة و10 دقائق.

كود Co-Director وA²RD متاح علناً على GitHub، بينما لا يزال كود CANVAS قيد الانتظار للإصدار. خط الأنابيب الكامل ليس منتج جوجل تجارياً بعد، لكن الأطر تستهدف مشكلتي التحسين العالمي وتتبع حالة العالم الكامنة في إنشاء فيديو بالذكاء الاصطناعي طويل الشكل.