A MiniMax lançou o modelo omnimodal de geração de vídeo H3 com pesos abertos no Hugging Face, apresentando áudio estéreo nativo que pode impulsionar o vídeo em uma única passagem direta. O modelo suporta resolução 2K a 24fps para clipes de 5 a 15 segundos e aceita até nove imagens de referência, três vídeos e três clipes de áudio por geração.
- O H3 permite entradas de texto, imagem, vídeo e áudio dentro de um contexto compartilhado.
- O modo orientado por áudio gera vídeo sincronizado com a trilha sonora de entrada.
- O modelo está disponível com pesos abertos para inferência local em hardware de consumo.
- O Seedance 2.5 da ByteDance oferece capacidades semelhantes, mas permanece apenas via API no BytePlus ModelArk.
A disponibilidade do H3 representa um marco significativo para a geração de vídeo local, fornecendo resultados de alta qualidade que anteriormente eram acessíveis apenas por meio de APIs proprietárias.