Google已发布Gemini Omni 1.1 Flash,这是其原生多模态视频生成模型的生产更新,重点从简单生成转向可引导编辑。此次更新通过Interactions API引入有状态交互,允许用户在保留先前上下文的情况下修改视频,而无需重新上传文件。
- 场景扩展现在可分析长达10秒的先前上下文,实现累计扩展至40秒。
- 用户可以固定首帧和末帧以控制摄像机运动,实现轨道运动和无缝循环等效果。
- 草稿以360p分辨率渲染,成本仅为720p的三分之一,最终输出可上采样至4K。
- 视频参考最多接受三个各三秒的片段,以保持角色一致性。
- 定价为每720p视频每秒约$0.10,所有输出均包含SynthID水印。
该模型可通过Gemini API和Google AI Studio获取,Adobe、Figma Weave、GMI Cloud和Runway已在其生产环境中使用。