MiniMaxは、テキスト、画像、動画、音声にわたる統一されたコンテキストを理解する汎用マルチモーダル生成モデル「MiniMax H3」をリリースしました。このモデルは、最大15秒の長さで2K解像度、ネイティブステレオサウンド付きの動画を生成します。

  • H3には、Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-Context Regenerationの技術が搭載されています。
  • 指示のフォロー、テキストとブランドの正確なレンダリング、V2Vモーション転送に優れています。
  • 2K解像度では、1秒あたりの料金が主要モデルの3分の1未満です。768pでは、主要モデルの720pの料金の半分未満です。
  • MiniMaxは、オープンソースコミュニティをサポートし、ハードウェアの互換性を加速させるため、数日中にオープンウェイトをリリースする計画です。

このリリースは、クローズドソースの動画生成モデルの支配に対抗し、ユーザー向けにオープンなエコシステムとカスタマイズ可能なバージョンを提供することを目的としています。