MiniMax telah merilis MiniMax H3, model generasi multimodal tujuan umum yang menyatukan teks, gambar, video, dan audio ke dalam satu konteks untuk menghasilkan klip video 2K hingga durasi 15 detik dengan suara stereo asli. Berbeda dengan tumpukan sebelumnya yang mengandalkan model ahli terpisah untuk tugas tertentu, H3 memungkinkan pengguna mengekspresikan hubungan referensi dan pengeditan melalui prompt bahasa alami.

  • Model ini menghasilkan video resolusi 2K dengan durasi 4–15 detik (hanya bilangan bulat).
  • Dilengkapi dengan tokenizer H3-VAE, yang memberikan peningkatan 4x pada panjang urutan efektif, memungkinkan keluaran 2K asli.
  • Transformer H3-Omni memisahkan beban kerja pemahaman dan generasi, meningkatkan throughput pelatihan end-to-end hampir sebesar 30%.
  • Regenerasi dalam konteks memungkinkan model dasar memulihkan detail halus dan teks kecil tanpa modul super-resolusi eksternal.
  • Harga dilaporkan sebesar $0.13 per detik untuk keluaran 2K, yang diklaim MiniMax kurang dari sepertiga dari model arus utama.

MiniMax H3 saat ini tersedia melalui API platform dengan ID model MiniMax-H3 dan di aplikasi konsumen Hailuo AI, dengan janji bobot terbuka dalam beberapa hari ke depan.