Google Researchは、アイデンティティのドリフトやマルチショットパイプラインで一般的に発生するカスケードエラーに対処することで、一貫性のある数分間の動画を生成するために設計された4つのエージェント型フレームワークからなるAI動画共同ディレクターを導入しました。このシステムはGeminiとVeoの上にモデル非依存のオーケストレーションレイヤーとして動作し、出力にはSynthID透かしを利用します。

スイートには、クリエイティブな計画のためにマルチアームバンディット探索を使用するCo-Director、キャラクターとオブジェクトの一貫性を維持するために永続的な視覚メモリを提供するCANVAS、セグメントごとの長時間動画生成のためのトレーニング不要のアーキテクチャであるA²RD、およびビジュアル質問応答によるクローズドループのプロンプト微調整を採用するVQQAが含まれます。

GoogleはGenAD-Bench、HardContinuityBench、LVBench-Cなどの新しいベンチマークを使用してこれらのフレームワークを評価しました。Co-DirectorはGenAD-Benchで81.4の平均スコアを達成し、A²RDは1分から10分の動画において最大30%の向上した一貫性と20%の向上したナラティブな整合性を示しました。

Co-DirectorとA²RDのコードはGitHubで公開されており、CANVASのコードはリリース待ちです。完全なパイプラインはまだ商業的なGoogle製品ではありませんが、これらのフレームワークは長時間形式のAI動画作成に内在するグローバル最適化とワールドステート追跡の問題を対象としています。