MiniMax telah merilis MiniMax H3, sebuah model generasi video multimodal bobot terbuka yang mampu memproses teks, gambar, video, dan audio. Model ini secara bersama-sama menghasilkan visual dan audio stereo tersinkronisasi, termasuk dialog, efek suara, suasana, dan musik, alih-alih menambahkan audio sebagai langkah pasca-pemrosesan.

  • Mendukung teks-ke-video, gambar-ke-video, generasi frame pertama dan terakhir, serta pembuatan berbasis referensi dalam ComfyUI.
  • Cekpoint bobot terbuka memungkinkan klip hingga 15 detik pada resolusi 768p.
  • Versi host model mendukung generasi hingga resolusi 2K.
  • Menggunakan representasi video kompresi tinggi untuk meningkatkan efisiensi di berbagai tugas generasi dalam satu arsitektur.

Rilis ini memungkinkan pengembang menyiapkan model secara lokal melalui ComfyUI untuk sintesis visual dan audio terintegrasi.