MiniMax a publié sur Hugging Face le modèle omnimodal de génération vidéo H3 à poids ouverts, doté d'un audio stéréo natif capable de piloter la vidéo en un seul passage avant. Le modèle prend en charge une résolution 2K à 24 fps pour des clips de 5 à 15 secondes et accepte jusqu'à neuf images de référence, trois vidéos et trois extraits audio par génération.

  • H3 permet les entrées texte, image, vidéo et audio dans un contexte partagé.
  • Le mode piloté par l'audio génère une vidéo synchronisée avec la piste sonore d'entrée.
  • Le modèle est disponible en poids ouverts pour l'inférence locale sur du matériel grand public.
  • Seedance 2.5 de ByteDance offre des capacités similaires mais reste accessible uniquement via API sur BytePlus ModelArk.

La disponibilité de H3 représente une étape importante pour la génération vidéo locale, offrant des résultats de haute qualité qui n'étaient auparavant accessibles que via des APIs propriétaires.