Google Research ha presentado un codirector de vídeo por IA compuesto por cuatro marcos agentic diseñados para generar vídeos coherentes de varios minutos abordando la deriva de identidad y los errores en cascada comunes en las tuberías multi-toma. El sistema opera como una capa de orquestación independiente del modelo sobre Gemini y Veo, utilizando marca de agua SynthID para la salida.

El conjunto incluye Co-Director, que utiliza búsqueda de bandit multi-brazo para la planificación creativa; CANVAS, que proporciona memoria visual persistente para mantener la consistencia de personajes y objetos; A²RD, una arquitectura sin entrenamiento para la generación de vídeo largo segmento por segmento; y VQQA, que emplea el refinamiento cerrado del prompt mediante respuesta a preguntas visuales.

Google evaluó estos marcos utilizando nuevos benchmarks incluyendo GenAD-Bench, HardContinuityBench y LVBench-C. Co-Director logró un promedio de 81.4 en GenAD-Bench, mientras que A²RD demostró hasta un 30% mejor consistencia y un 20% mejor coherencia narrativa en vídeos que van de 1 a 10 minutos.

El código de Co-Director y A²RD está disponible públicamente en GitHub, con el código de CANVAS pendiente de lanzamiento. La tubería completa aún no es un producto comercial de Google, pero los marcos abordan los problemas de optimización global y seguimiento del estado del mundo inherentes a la creación de vídeo por IA de formato largo.