MiniMax merilis model generasi video omni-modal H3 dengan bobot terbuka di Hugging Face, yang menampilkan audio stereo asli yang dapat menggerakkan video dalam satu langkah maju. Model ini mendukung resolusi 2K pada 24fps untuk klip selama 5 hingga 15 detik dan menerima hingga sembilan gambar referensi, tiga video, dan tiga klip audio per generasi.

  • H3 memungkinkan input teks, gambar, video, dan audio dalam konteks bersama.
  • Mode yang digerakkan oleh audio menghasilkan video yang disinkronkan dengan trek suara input.
  • Model ini tersedia sebagai bobot terbuka untuk inferensi lokal pada perangkat keras konsumen.
  • Seedance 2.5 dari ByteDance menawarkan kemampuan serupa tetapi tetap hanya melalui API di BytePlus ModelArk.

Ketersediaan H3 merupakan tonggak penting untuk generasi video lokal, menyediakan hasil berkualitas tinggi yang sebelumnya hanya dapat diakses melalui API tertutup.