Google Research a présenté un co-réalisateur vidéo IA composé de quatre cadres agents conçus pour générer des vidéos cohérentes de plusieurs minutes en traitant les dérives d'identité et les erreurs en cascade courantes dans les pipelines multi-prises. Le système fonctionne comme une couche d'orchestration indépendante du modèle au-dessus de Gemini et Veo, utilisant le filigrane SynthID pour la sortie.

La suite comprend Co-Director, qui utilise la recherche par bandits à plusieurs bras pour la planification créative ; CANVAS, qui fournit une mémoire visuelle persistante pour maintenir la cohérence des personnages et des objets ; A²RD, une architecture sans entraînement pour la génération vidéo longue segment par segment ; et VQQA, qui emploie un raffinement de prompt en boucle fermée via la réponse aux questions visuelles.

Google a évalué ces cadres à l'aide de nouveaux benchmarks incluant GenAD-Bench, HardContinuityBench et LVBench-C. Co-Director a obtenu une moyenne de 81,4 sur GenAD-Bench, tandis qu'A²RD a démontré jusqu'à 30 % de cohérence supérieure et 20 % de cohérence narrative meilleure sur des vidéos allant de 1 à 10 minutes.

Le code de Co-Director et A²RD est publiquement disponible sur GitHub, le code de CANVAS étant en attente de publication. Le pipeline complet n'est pas encore un produit commercial de Google, mais les cadres visent les problèmes d'optimisation globale et de suivi de l'état du monde inhérents à la création vidéo IA longue forme.