MiniMax ha puesto su modelo MiniMax-H3 disponible en Hugging Face. Este sistema generativo omnimodal de propósito general admite la comprensión unificada de contextos multimodales compuestos por texto, imágenes, video y audio.
- Puede generar video con audio estéreo nativo en resoluciones de hasta 2K y duraciones de hasta 15 segundos.
- El modelo posee amplias capacidades de comprensión y generación de contextos multimodales en la etapa de preentrenamiento.
- Este diseño permite un rendimiento destacado al seguir instrucciones multimodales complejas.