MiniMax a publié MiniMax H3, un modèle de génération multimodale polyvalent qui unifie le texte, l'image, la vidéo et l'audio dans un seul contexte pour produire des clips vidéo 2K d'une durée maximale de 15 secondes avec du son stéréo natif. Contrairement aux précédentes architectures reposant sur des modèles experts distincts pour des tâches spécifiques, H3 permet aux utilisateurs d'exprimer des relations de référence et d'édition via des invites en langage naturel.
- Le modèle génère des vidéos à une résolution 2K avec des durées de 4 à 15 secondes (entiers uniquement).
- Il intègre le tokenizeur H3-VAE, qui offre un gain de 4x sur la longueur effective de la séquence, permettant une sortie native en 2K.
- Le transformateur H3-Omni sépare les charges de travail de compréhension et de génération, augmentant le débit d'entraînement de bout en bout de près de 30 %.
- La régénération in-contexte permet au modèle de base de récupérer les détails fins et le petit texte sans modules de super-résolution externes.
- Le prix est indiqué à 0,13 $ par seconde pour une sortie 2K, ce que MiniMax affirme être moins du tiers des modèles grand public.
MiniMax H3 est actuellement disponible via l'API de la plateforme sous l'identifiant de modèle MiniMax-H3 et dans l'application grand public Hailuo AI, avec des poids ouverts promis dans les jours à venir.