MiniMax发布了MiniMax H3,这是一个开放权重的多模态视频生成模型,能够处理文本、图像、视频和音频。该模型联合生成视觉内容和同步立体声音频,包括对话、音效、环境音和音乐,而不是将音频作为后处理步骤添加。
- 支持在ComfyUI中进行文生视频、图生视频、首尾帧生成以及参考驱动创作。
- 开放权重的检查点允许生成长达15秒、分辨率为768p的片段。
- 模型的托管版本支持高达2K分辨率的生成。
- 利用高压缩视频表示,在单一架构内提高多项生成任务的效率。
此次发布使开发人员能够通过ComfyUI在本地设置模型,以实现视觉和音频的综合合成。