MiniMax telah meluncurkan MiniMax H3, model generasi multimodal tujuan umum yang memahami konteks terpadu di antara teks, gambar, video, dan audio. Model ini menghasilkan video dengan suara stereo asli hingga durasi 15 detik dan resolusi 2K.

  • H3 memiliki teknologi Contextual Omni Representation, H3-VAE, H3-Omni Transformer, dan In-Context Regeneration.
  • Model ini unggul dalam mengikuti instruksi, rendering teks dan merek yang akurat, serta transfer gerakan V2V.
  • Pada resolusi 2K, harga per detik kurang dari sepertiga model utama; pada 768p, harganya kurang dari setengah harga 720p model utama.
  • MiniMax berencana merilis bobot terbuka dalam beberapa hari ke depan untuk mendukung komunitas open-source dan mempercepat kompatibilitas perangkat keras.

Rilis ini bertujuan mengatasi dominasi model generasi video sumber tertutup dengan menyediakan ekosistem terbuka dan versi yang dapat disesuaikan untuk pengguna.