A MiniMax lançou o MiniMax H3, um modelo multimodal de propósito geral que unifica texto, imagem, vídeo e áudio em um único contexto para produzir clipes de vídeo em 2K com até 15 segundos de duração e som estéreo nativo. Diferente das pilhas anteriores que dependem de modelos especialistas separados para tarefas específicas, o H3 permite que os usuários expressem relações de referência e edição por meio de prompts em linguagem natural.
- O modelo gera vídeo em resolução 2K com durações de 4 a 15 segundos (apenas números inteiros).
- Ele apresenta o tokenizador H3-VAE, que proporciona um ganho de 4x no comprimento efetivo da sequência, permitindo saída nativa em 2K.
- O Transformer H3-Omni separa as cargas de trabalho de compreensão e geração, aumentando o throughput de treinamento end-to-end em quase 30%.
- A regeneração in-context permite que o modelo base recupere detalhes finos e pequenos textos sem módulos externos de super-resolução.
- O preço é relatado como US$ 0,13 por segundo para saída em 2K, o que a MiniMax afirma ser menos de um terço dos modelos convencionais.
O MiniMax H3 está atualmente disponível via API da plataforma sob o ID do modelo MiniMax-H3 e no aplicativo consumer Hailuo AI, com pesos abertos prometidos nos próximos dias.