MiniMaxは、そのMiniMax-H3モデルをHugging Faceで公開しました。この汎用オムニモーダル生成システムは、テキスト、画像、動画、音声で構成されるマルチモーダルコンテキストの統合理解をサポートします。
- 2K解像度、最大15秒間の動画とネイティブステレオオーディオを生成できます。
- このモデルは、事前学習段階において広範なマルチモーダルコンテキストの理解と生成能力を持っています。
- この設計により、複雑なマルチモーダル指示に従う際の優れたパフォーマンスを実現します。
MiniMaxは、そのMiniMax-H3モデルをHugging Faceで公開しました。この汎用オムニモーダル生成システムは、テキスト、画像、動画、音声で構成されるマルチモーダルコンテキストの統合理解をサポートします。