MiniMax a lancé MiniMax H3, un modèle multimodal de génération vidéo à poids ouverts capable de traiter du texte, des images, de la vidéo et de l'audio. Le modèle génère conjointement des visuels et de l'audio stéréo synchronisé, incluant des dialogues, des effets sonores, une ambiance et de la musique, au lieu d'ajouter l'audio comme une étape de post-traitement.
- Prend en charge le texte vers vidéo, image vers vidéo, génération du premier et dernier cadre, et création pilotée par référence dans ComfyUI.
- Les checkpoints à poids ouverts permettent des clips jusqu'à 15 secondes à une résolution de 768p.
- La version hébergée du modèle prend en charge la génération jusqu'à une résolution de 2K.
- Utilise une représentation vidéo haute compression pour améliorer l'efficacité sur plusieurs tâches de génération au sein d'une seule architecture.
Le lancement permet aux développeurs de configurer le modèle localement via ComfyUI pour une synthèse intégrée de visuels et d'audio.