MiniMax ha lanzado MiniMax H3, un modelo de generación multimodales de propósito general que unifica texto, imagen, video y audio en un solo contexto para producir clips de video en 2K de hasta 15 segundos con sonido estéreo nativo. A diferencia de las pilas anteriores que dependen de modelos expertos separados para tareas específicas, H3 permite a los usuarios expresar relaciones de referencia y edición mediante prompts en lenguaje natural.

  • El modelo produce video en resolución 2K con duraciones de 4–15 segundos (solo enteros).
  • Cuenta con el tokenizador H3-VAE, que proporciona una ganancia de 4x en la longitud efectiva de la secuencia, permitiendo salida nativa en 2K.
  • El Transformer H3-Omni separa las cargas de trabajo de comprensión y generación, aumentando el rendimiento de entrenamiento de extremo a extremo casi un 30%.
  • La regeneración in-context permite que el modelo base recupere detalles finos y texto pequeño sin módulos externos de super-resolución.
  • Se informa que el precio es de $0.13 por segundo para salida en 2K, lo cual MiniMax afirma que es menos de un tercio del costo de los modelos principales.

MiniMax H3 está actualmente disponible a través de la API de la plataforma bajo el ID de modelo MiniMax-H3 y en la aplicación de consumo Hailuo AI, con promesa de pesos abiertos en los próximos días.