MiniMaxは、テキスト、画像、動画、オーディオを処理できるオープンウェイトのマルチモーダル動画生成モデル「MiniMax H3」をリリースしました。このモデルは、オーディオを後処理ステップとして追加するのではなく、視覚と同期したステレオオーディオ(会話、効果音、環境音、音楽を含む)を同時に生成します。
- ComfyUI内でテキストから動画、画像から動画、最初および最後のフレームの生成、参照駆動型作成をサポート。
- オープンウェイトのチェックポイントにより、768p解像度で最大15秒のクリップを作成可能。
- ホスト版モデルは最大2K解像度での生成をサポート。
- 単一アーキテクチャ内で複数の生成タスク全体の効率を向上させるために、高圧縮動画表現を利用。
今回のリリースにより、開発者はComfyUIを通じてモデルをローカルにセットアップし、視覚とオーディオの統合合成を行うことができます。