VideoX-Qwen 推出以数据为中心的指令驱动视频编辑框架
研究人员推出了 VideoX-Qwen,这是一个集成框架,将可扩展的数据构建与模型训练相结合,以推进通用、指令驱动的视频编辑。该系统利用生产流水线组织专用模型生成方向性编辑记录,从而在添加、删除、替换和属性任务中产生超过 120 万份高质量样本。
研究人员推出了 VideoX-Qwen,这是一个集成框架,将可扩展的数据构建与模型训练相结合,以推进通用、指令驱动的视频编辑。该系统利用生产流水线组织专用模型生成方向性编辑记录,从而在添加、删除、替换和属性任务中产生超过 120 万份高质量样本。
Higgsfield AI 已集成 OpenAI 的 GPT-6 Astra 模型,以加速其内部开发工作流程并增强其视频广告创作平台。该公司表示,该模型使一名工程师能够在短短一天内交付新的探索性功能。
研究人员引入了并行解码蒸馏(PDD),这是一种简化的基于轨迹的方法,用于加速扩散模型和流匹配模型的推理。与当前依赖难以优化的变分分数蒸馏和对抗性损失的方法不同,PDD 在每次网络评估中预测多个去噪步骤。
NanoAvatar 是一个开源项目,可在较旧的 Android 手机上本地运行逼真的说话头像,无需依赖云端 GPU。此次发布包含公开代码、模型权重以及捆绑了模型和用户自有声音头像的 Android APK,支持离线使用。
Vidu S2 包含 Vidu S2-Avatar(实时交互数字角色模型)和 Vidu S2-Editing(实时视频编辑模型)。该系统还探索了为这两个组件实现实时空间视频生成的可行性。
一位用户发布了使用新发布的 DeepSeek V4.1 Flash 模型生成的视频,以测试其在运动视频合成方面的能力。
一位用户一直在使用 Seedance 2.5 创建 AI 生成的视频,利用提供对 Seedance 和其他模型访问权限的 AIide API 平台。
用户测试了 Seedance 2.5 视频生成模型,使用了一段简短的时尚和编辑序列,其中包含一个角色穿着不同的服装、构图和视觉风格。
2026年9月初,英伟达确认以129.3亿美元收购 Hugging Face,同时 OpenAI 发布了 GPT-6 Astra,微软推出了语音识别模型 MAI-Transcribe-2。
一名用户使用了短小的时尚和编辑类视频概念来测试 Seedance 2.5 模型,以评估其在序列间保持视觉一致性的能力。
Google已发布Gemini Omni 1.1 Flash,这是其原生多模态视频生成模型的生产更新,重点从简单生成转向可引导编辑。此次更新通过Interactions API引入有状态交互,允许用户在保留先前上下文的情况下修改视频,而无需重新上传文件。
Google 推出了 Gemini Omni 1.1 Flash,新增了扩展场景、插值首尾帧、4K 超分辨率以及通过 Gemini API 实现更快的视频迭代等控制功能。
对 Seedance 2 AI 视频生成模型的评估凸显了其与早期版本相比,对电影元素的更好理解。测试表明,虽然该模型在处理视觉连续性和光照方面表现良好,但在复杂物体的一致性和提示词过载方面仍存在困难。
OpenAI首席科学家Jakub Pachocki表示,未发布的Astra模型旨在在2026年9月前成为“自动化AI研究实习生”,而CEO Sam Altman估计公司将在2026年12月内部宣布实现AGI。
Google推出了Gemini Omni 1.1 Flash,这是一套全新的创意控制工具与生成式视频能力,旨在通过Google AI Studio中的Gemini API使该模型具备面向专业用途的生产就绪状态。