Google Research представила ИИ-со-режиссёра, состоящего из четырёх агентных фреймворков, предназначенных для создания согласованных видео длительностью в несколько минут за счёт устранения дрейфа идентичности и каскадных ошибок, характерных для многокадровых конвейеров. Система работает как модель-агностический оркеструющий слой поверх Gemini и Veo, используя водяной знак SynthID для вывода.
Пакет включает Co-Director, использующий поиск с помощью многоармного бандита для творческого планирования; CANVAS, обеспечивающий постоянную визуальную память для поддержания согласованности персонажей и объектов; A²RD — архитектуру без дообучения для пошагового генерирования длинных видео; и VQQA, применяющую замкнутый цикл уточнения промптов через визуальный ответ на вопросы.
Google оценила эти фреймворки с помощью новых бенчмарков, включая GenAD-Bench, HardContinuityBench и LVBench-C. Co-Director достиг среднего показателя 81.4 на GenAD-Bench, в то время как A²RD продемонстрировала до 30% лучшую согласованность и на 20% более высокую нарративную связность для видео длительностью от 1 до 10 минут.
Код Co-Director и A²RD публично доступен на GitHub, код CANVAS находится в ожидании публикации. Полный конвейер пока не является коммерческим продуктом Google, но фреймворки направлены на решение проблем глобальной оптимизации и отслеживания состояния мира, присущих созданию длинных ИИ-видео.