MiniMax lanzó el modelo omnimodal de generación de video H3 con pesos abiertos en Hugging Face, que cuenta con audio estéreo nativo capaz de impulsar el video en un solo paso hacia adelante. El modelo admite resolución 2K a 24 fps para clips de 5 a 15 segundos y acepta hasta nueve imágenes de referencia, tres videos y tres clips de audio por generación.

  • H3 permite entradas de texto, imagen, video y audio dentro de un contexto compartido.
  • El modo impulsado por audio genera video sincronizado con la pista de sonido de entrada.
  • El modelo está disponible con pesos abiertos para inferencia local en hardware de consumo.
  • Seedance 2.5 de ByteDance ofrece capacidades similares pero permanece solo a través de API en BytePlus ModelArk.

La disponibilidad de H3 representa un hito significativo para la generación de video local, proporcionando resultados de alta calidad que anteriormente solo eran accesibles mediante APIs propietarias.