MiniMax在Hugging Face上发布了开源权重的H3全模态视频生成模型,该模型具备原生立体声功能,可通过单次前向传递驱动视频。该模型支持2K分辨率、24fps的 clips,时长为5到15秒,并允许每次生成最多接受9张参考图像、3个视频和3段音频。

  • H3允许在共享上下文中输入文本、图像、视频和音频。
  • 音频驱动模式生成与输入音轨同步的视频。
  • 该模型以开源权重形式提供,可在消费级硬件上进行本地推理。
  • ByteDance的Seedance 2.5提供类似功能,但仅通过BytePlus ModelArk的API可用。

H3的发布标志着本地视频生成的一个重要里程碑,提供了以前只能通过专有API获得的高质量结果。