MiniMax a rendu son modèle MiniMax-H3 disponible sur Hugging Face. Ce système génératif omnimodal à usage général prend en charge la compréhension unifiée des contextes multimodaux composés de texte, d'images, de vidéo et d'audio.

  • Il peut générer des vidéos avec un audio stéréo natif jusqu'à une résolution de 2K et une durée de 15 secondes.
  • Le modèle possède de larges capacités de compréhension et de génération de contextes multimodaux au stade du pré-entraînement.
  • Cette conception permet des performances exceptionnelles dans le suivi d'instructions multimodales complexes.