MiniMax telah membuat model MiniMax-H3-nya tersedia di Hugging Face. Sistem generatif omni-modal serbaguna ini mendukung pemahaman terpadu dari konteks multimodal yang terdiri dari teks, gambar, video, dan audio.

  • Model ini dapat menghasilkan video dengan audio stereo asli pada resolusi hingga 2K dan durasi hingga 15 detik.
  • Model ini memiliki kemampuan pemahaman dan generasi konteks multimodal yang luas pada tahap pra-pelatihan.
  • Desain ini memungkinkan kinerja luar biasa dalam mengikuti instruksi multimodal yang kompleks.