MiniMax ha lanzado MiniMax H3, un modelo de generación multimodal de propósito general que comprende el contexto unificado entre texto, imágenes, video y audio. El modelo genera video con sonido estéreo nativo de hasta 15 segundos de duración y resolución 2K.
- H3 cuenta con las tecnologías Contextual Omni Representation, H3-VAE, H3-Omni Transformer e In-Context Regeneration.
- Destaca en el seguimiento de instrucciones, la representación precisa de texto y marcas, y la transferencia de movimiento V2V.
- A resolución 2K, el precio por segundo es menos de un tercio del de los modelos principales; a 768p, es menos de la mitad del precio del 720p de los modelos principales.
- MiniMax planea liberar los pesos abiertos en los próximos días para apoyar a la comunidad de código abierto y acelerar la compatibilidad con hardware.
El lanzamiento busca abordar el dominio de los modelos de generación de video de código cerrado proporcionando un ecosistema abierto y versiones personalizables para los usuarios.