Google Research 推出了一款由四个智能体框架组成的AI视频联合导演系统,旨在通过解决多镜头流水线中常见的身份漂移和级联错误,生成连贯的、长达数分钟的视频。该系统作为模型无关的编排层,运行在 Gemini 和 Veo 之上,并使用 SynthID 水印技术对输出进行处理。
该套件包括:Co-Director,利用多臂老虎机搜索进行创意规划;CANVAS,提供持久视觉记忆以维持角色和物体的一致性;A²RD,一种无需训练的、逐段生成长视频的架构;以及 VQQA,通过视觉问答实现闭环提示词优化。
Google 使用新的基准测试对这些框架进行了评估,包括 GenAD-Bench、HardContinuityBench 和 LVBench-C。Co-Director 在 GenAD-Bench 上取得了 81.4 的平均分,而 A²RD 在1到10分钟的视频中展现了高达30%的一致性提升和20%的叙事连贯性改善。
Co-Director 和 A²RD 的代码已在 GitHub 上公开,CANVAS 的代码待发布。该完整流水线尚未成为 Google 的商业产品,但这些框架旨在解决长格式 AI 视频创作中固有的全局优化和世界状态跟踪问题。