Black Forest Labs 发布了 FLUX 3,这是一种多模态基础模型,能够在单一架构中从图像、视频和音频中学习。它是首款通过一组权重提供视频、音频和动作预测的 FLUX 模型。
- 该模型基于 Self-Flow 方法,将流匹配与自监督特征重建相结合。
- FLUX 3 Video 可在单次生成中输出长达 20 秒且原生包含音频的视频片段。
- 支持的模态包括文生视频、图生视频、视频到视频、关键帧到视频以及生成式视频-音频续写。
- 在针对 10 秒 720p 片段的真人偏好测试中,FLUX 3 在 93% 的比较中优于 Luma Ray 3.2,在 77% 的比较中优于 Runway Gen-4.5。
此次发布旨在提供一个统一的模型,使各模态相互约束,确保声音与冲击匹配,且运动符合质量规律。