A MiniMax lançou o modelo omnimodal de geração de vídeo H3 com pesos abertos no Hugging Face, apresentando áudio estéreo nativo que pode impulsionar o vídeo em uma única passagem direta. O modelo suporta resolução 2K a 24fps para clipes de 5 a 15 segundos e aceita até nove imagens de referência, três vídeos e três clipes de áudio por geração.

  • O H3 permite entradas de texto, imagem, vídeo e áudio dentro de um contexto compartilhado.
  • O modo orientado por áudio gera vídeo sincronizado com a trilha sonora de entrada.
  • O modelo está disponível com pesos abertos para inferência local em hardware de consumo.
  • O Seedance 2.5 da ByteDance oferece capacidades semelhantes, mas permanece apenas via API no BytePlus ModelArk.

A disponibilidade do H3 representa um marco significativo para a geração de vídeo local, fornecendo resultados de alta qualidade que anteriormente eram acessíveis apenas por meio de APIs proprietárias.