MiniMax在Hugging Face上发布了开源权重的H3全模态视频生成模型,该模型具备原生立体声功能,可通过单次前向传递驱动视频。该模型支持2K分辨率、24fps的 clips,时长为5到15秒,并允许每次生成最多接受9张参考图像、3个视频和3段音频。
- H3允许在共享上下文中输入文本、图像、视频和音频。
- 音频驱动模式生成与输入音轨同步的视频。
- 该模型以开源权重形式提供,可在消费级硬件上进行本地推理。
- ByteDance的Seedance 2.5提供类似功能,但仅通过BytePlus ModelArk的API可用。
H3的发布标志着本地视频生成的一个重要里程碑,提供了以前只能通过专有API获得的高质量结果。