MiniMax发布了MiniMax H3,这是一款通用的多模态生成模型,将文本、图像、视频和音频统一到一个上下文中,以生成长达15秒、带有原生立体声音效的2K视频片段。与依赖特定任务专用专家模型的先前架构不同,H3允许用户通过自然语言提示来表达参考和编辑关系。

  • 该模型输出分辨率为2K、时长为4–15秒(仅限整数)的视频。
  • 它采用了H3-VAE分词器,有效序列长度提升4倍,从而实现原生2K输出。
  • H3-Omni Transformer将理解与生成工作负载分离,使端到端训练吞吐量提高了近30%。
  • 上下文再生功能使基础模型能够在无需外部超分辨率模块的情况下恢复细节和小文本。
  • 据报道,2K输出的定价为每秒0.13美元,MiniMax声称这不到主流模型的三分之一。

MiniMax H3目前可通过平台API使用,模型ID为MiniMax-H3,也可在消费级应用Hailuo AI中使用,开放权重将在未来几天内公布。