Google Research ने एक AI वीडियो सह-निदेशक का परिचय दिया है, जिसमें चार एजेंटिक फ्रेमवर्क शामिल हैं जो बहु-शॉट पाइपलाइन में आम पहचान विचलन और श्रृंखलाबद्ध त्रुटियों को दूर करके सहसंबद्ध, मिनटों तक चलने वाले वीडियो उत्पन्न करने के लिए डिज़ाइन किए गए हैं। सिस्टम Gemini और Veo के ऊपर एक मॉडल-अज्ञेय ऑर्केस्ट्रेशन परत के रूप में काम करता है, जिसमें आउटपुट के लिए SynthID वाटरमार्किंग का उपयोग किया जाता है।

इस सूट में Co-Director शामिल है, जो रचनात्मक योजना के लिए मल्टी-आर्म्ड बैंडिट खोज का उपयोग करता है; CANVAS, जो पात्र और वस्तु स्थिरता बनाए रखने के लिए स्थायी दृश्य मेमोरी प्रदान करता है; A²RD, जो खंड-दर-खंड लंबे वीडियो निर्माण के लिए ट्रेनिंग-फ्री आर्किटेक्चर है; और VQQA, जो दृश्य प्रश्न उत्तर देने के माध्यम से बंद-लूप प्रॉम्प्ट परिष्करण का उपयोग करता है।

Google ने GenAD-Bench, HardContinuityBench, और LVBench-C सहित नए बेंचमार्क का उपयोग करके इन फ्रेमवर्क का मूल्यांकन किया। Co-Director ने GenAD-Bench पर 81.4 औसत हासिल किया, जबकि A²RD ने 1 से 10 मिनट तक के वीडियो पर 30% बेहतर स्थिरता और 20% बेहतर कथानक सहसंबंध दिखाया।

Co-Director और A²RD का कोड GitHub पर सार्वजनिक रूप से उपलब्ध है, जबकि CANVAS का कोड जारी होने की प्रतीक्षा में है। पूर्ण पाइपलाइन अभी तक एक वाणिज्यिक Google उत्पाद नहीं है, लेकिन ये फ्रेमवर्क लंबे-प्रारूप AI वीडियो निर्माण में निहित वैश्विक अनुकूलन और विश्व-अवस्था ट्रैकिंग समस्याओं को लक्षित करते हैं।