MiniMax已将其MiniMax-H3模型在Hugging Face上开放。这个通用全模态生成系统支持对由文本、图像、视频和音频组成的多模态上下文的统一理解。

  • 它可以生成具有原生立体声的2K分辨率视频,时长长达15秒。
  • 该模型在预训练阶段具备广泛的多模态上下文理解和生成能力。
  • 这种设计使其在遵循复杂多模态指令方面表现出色。