MiniMax ha lanzado MiniMax H3, un modelo multimodal de generación de video con pesos abiertos capaz de procesar texto, imágenes, video y audio. El modelo genera conjuntamente visuales y audio estéreo sincronizado, incluyendo diálogos, efectos de sonido, ambiente y música, en lugar de añadir el audio como un paso de postprocesamiento.
- Soporta texto a video, imagen a video, generación del primer y último cuadro, y creación impulsada por referencia dentro de ComfyUI.
- Los checkpoints de pesos abiertos permiten clips de hasta 15 segundos a resolución 768p.
- La versión alojada del modelo soporta generación hasta resolución 2K.
- Utiliza una representación de video de alta compresión para mejorar la eficiencia en múltiples tareas de generación dentro de una sola arquitectura.
El lanzamiento permite a los desarrolladores configurar el modelo localmente a través de ComfyUI para la síntesis integrada de visuales y audio.