invideo 借助 GPT-6 Astra 将调色效率提升 3 倍
invideo 利用 GPT-6 Astra 增强其智能视频编辑能力,使调色成功率提高三倍,并在一天内生成 50 种自定义特效。
invideo 利用 GPT-6 Astra 增强其智能视频编辑能力,使调色成功率提高三倍,并在一天内生成 50 种自定义特效。
Higgsfield AI 已集成 OpenAI 的 GPT-6 Astra 模型,以加速其内部开发工作流程并增强其视频广告创作平台。该公司表示,该模型使一名工程师能够在短短一天内交付新的探索性功能。
研究人员引入了并行解码蒸馏(PDD),这是一种简化的基于轨迹的方法,用于加速扩散模型和流匹配模型的推理。与当前依赖难以优化的变分分数蒸馏和对抗性损失的方法不同,PDD 在每次网络评估中预测多个去噪步骤。
2026年9月初,英伟达确认以129.3亿美元收购 Hugging Face,同时 OpenAI 发布了 GPT-6 Astra,微软推出了语音识别模型 MAI-Transcribe-2。
来自NVIDIA、麻省理工学院和牛津大学的研究人员推出了Physis-Lang,这是一个通过将自我演化的物理语言整合到字幕中来增强视频世界模型的框架。该方法将物理语言视为一种可优化的表示形式,用于数据筛选、模型训练和推理,以纠正生成视频中的物理错误。
Google Research 推出了一款由四个智能体框架组成的AI视频联合导演系统,旨在通过解决多镜头流水线中常见的身份漂移和级联错误,生成连贯的、长达数分钟的视频。该系统作为模型无关的编排层,运行在 Gemini 和 Veo 之上,并使用 SynthID 水印技术对输出进行处理。
Runway推出了GWM Worlds 2,这是一个研究预览版,通过自回归扩散模型将高保真视频和音频生成转化为实时交互模拟。此次发布包含WorldPrompt,这是一种新的输入格式,允许用户通过固定环境方面并创建带时间戳的事件来指定生成的世界和动作。
研究人员推出了 VideoX-Qwen,这是一个集成框架,将可扩展的数据构建与模型训练相结合,以推进通用、指令驱动的视频编辑。该系统利用生产流水线组织专用模型生成方向性编辑记录,从而在添加、删除、替换和属性任务中产生超过 120 万份高质量样本。
NanoAvatar 是一个开源项目,可在较旧的 Android 手机上本地运行逼真的说话头像,无需依赖云端 GPU。此次发布包含公开代码、模型权重以及捆绑了模型和用户自有声音头像的 Android APK,支持离线使用。
Vidu S2 包含 Vidu S2-Avatar(实时交互数字角色模型)和 Vidu S2-Editing(实时视频编辑模型)。该系统还探索了为这两个组件实现实时空间视频生成的可行性。
一位用户发布了使用新发布的 DeepSeek V4.1 Flash 模型生成的视频,以测试其在运动视频合成方面的能力。
一位用户一直在使用 Seedance 2.5 创建 AI 生成的视频,利用提供对 Seedance 和其他模型访问权限的 AIide API 平台。
用户测试了 Seedance 2.5 视频生成模型,使用了一段简短的时尚和编辑序列,其中包含一个角色穿着不同的服装、构图和视觉风格。