O Google Research apresentou um co-diretor de vídeo por IA composto por quatro estruturas agênticas projetadas para gerar vídeos coerentes com duração de minutos, abordando a deriva de identidade e erros em cascata comuns em pipelines multi-takes. O sistema opera como uma camada de orquestração independente de modelo sobre o Gemini e Veo, utilizando marca d'água SynthID na saída.
O conjunto inclui Co-Director, que usa busca por bandit multibraço para planejamento criativo; CANVAS, que fornece memória visual persistente para manter a consistência de personagens e objetos; A²RD, uma arquitetura sem treinamento para geração de vídeos longos segmento por segmento; e VQQA, que emprega refinamento de prompt em loop fechado por meio de perguntas e respostas visuais.
O Google avaliou essas estruturas usando novos benchmarks, incluindo GenAD-Bench, HardContinuityBench e LVBench-C. Co-Director alcançou uma média de 81,4 no GenAD-Bench, enquanto A²RD demonstrou até 30% mais consistência e 20% melhor coerência narrativa em vídeos com duração de 1 a 10 minutos.
O código do Co-Director e A²RD está disponível publicamente no GitHub, com o código do CANVAS pendente de lançamento. O pipeline completo ainda não é um produto comercial do Google, mas as estruturas visam resolver os problemas de otimização global e rastreamento de estado do mundo inerentes à criação de vídeos longos por IA.