Google Research는 다중 샷 파이프라인에서 흔히 발생하는 아이덴티티 드리프트와 연쇄 오류를 해결하여 일관되고 수 분 길이의 비디오를 생성하도록 설계된 네 개의 에이전트 프레임워크로 구성된 AI 비디오 공동 디렉터를 소개했습니다. 이 시스템은 Gemini와 Veo 위에 모델 비종속성 오케스트레이션 레이어로 작동하며, 출력에는 SynthID 워터마킹을 활용합니다.

이 스위트(suite)에는 창의적 기획을 위해 다중 팔 밴딧 검색을 사용하는 Co-Director, 캐릭터와 객체의 일관성을 유지하기 위해 영구 시각적 메모리를 제공하는 CANVAS, 세그먼트별 긴 비디오 생성을 위한 학습 없는 아키텍처인 A²RD, 그리고 시각적 질문 답변을 통한 폐쇄 루프 프롬프트 정제를 활용하는 VQQA가 포함됩니다.

Google은 GenAD-Bench, HardContinuityBench, LVBench-C를 포함한 새로운 벤치마크를 사용하여 이러한 프레임워크를 평가했습니다. Co-Director는 GenAD-Bench에서 81.4의 평균을 달성했으며, A²RD는 1분에서 10분에 이르는 비디오에서 최대 30% 향상된 일관성과 20% 향상된 내러티브 일관성을 보여주었습니다.

Co-Director와 A²RD 코드는 GitHub에서 공개되었으며, CANVAS 코드는 출시를 앞두고 있습니다. 전체 파이프라인은 아직 상용 Google 제품이 아니지만, 이 프레임워크들은 장편 AI 비디오 생성에 내재된 전역 최적화 및 세계 상태 추적 문제를 목표로 합니다.