MiniMax a lancé MiniMax H3, un modèle de génération multimodale à usage général qui comprend le contexte unifié entre le texte, les images, la vidéo et l'audio. Le modèle génère de la vidéo avec du son stéréo natif d'une durée allant jusqu'à 15 secondes et une résolution 2K.

  • H3 intègre les technologies Contextual Omni Representation, H3-VAE, H3-Omni Transformer et In-Context Regeneration.
  • Il excelle dans le suivi des instructions, le rendu précis du texte et des marques, et le transfert de mouvement V2V.
  • À la résolution 2K, le prix par seconde est inférieur au tiers des modèles principaux ; à 768p, il est inférieur à la moitié du prix du 720p des modèles principaux.
  • MiniMax prévoit de publier les poids ouverts dans les prochains jours pour soutenir la communauté open-source et accélérer la compatibilité matérielle.

Le lancement vise à contrer la domination des modèles de génération vidéo à code fermé en fournissant un écosystème ouvert et des versions personnalisables pour les utilisateurs.