MiniMaxは、Hugging FaceでオープンウェイトのH3オムニモーダル動画生成モデルをリリースしました。このモデルはネイティブステレオオーディオを搭載し、単一フォワードパスで動画を駆動できます。モデルは5〜15秒のクリップに対して2K解像度・24fpsをサポートし、1回の生成あたり最大9枚の参照画像、3本の動画、3つのオーディオクリップを受け入れます。

  • H3は共有コンテキスト内でテキスト、画像、動画、オーディオの入力を許可します。
  • オーディオ駆動モードは、入力音声トラックと同期した動画を生成します。
  • モデルは消費向けハードウェアでのローカル推論用にオープンウェイトとして利用可能です。
  • ByteDanceのSeedance 2.5も同様の機能を提供しますが、BytePlus ModelArk経由のAPIのみで利用可能です。

H3の利用可能性は、ローカル動画生成にとって重要なマイルストーンであり、以前はプロプライエタリなAPIでのみアクセス可能だった高品質な結果を提供します。