MiniMax 推出了 MiniMax H3,这是一款通用的多模态生成模型,能够理解文本、图像、视频和音频的统一上下文。该模型可生成带有原生立体声的视频,时长长达 15 秒,分辨率为 2K。

  • H3 具备 Contextual Omni Representation、H3-VAE、H3-Omni Transformer 和 In-Context Regeneration 技术。
  • 它在遵循指令、准确渲染文本和品牌以及 V2V 运动迁移方面表现出色。
  • 在 2K 分辨率下,每秒价格不到主流模型的三分之一;在 768p 下,价格不到主流模型 720p 的一半。
  • MiniMax 计划在未来几天内发布开源权重,以支持开源社区并加速硬件兼容性。

此次发布旨在通过提供开放生态系统和可定制版本,解决闭源视频生成模型的垄断地位。