A MiniMax disponibilizou seu modelo MiniMax-H3 no Hugging Face. Este sistema generativo omnimodal de propósito geral suporta a compreensão unificada de contextos multimodais compostos por texto, imagens, vídeo e áudio.
- Ele pode gerar vídeos com áudio estéreo nativo em resoluções de até 2K e durações de até 15 segundos.
- O modelo possui amplas capacidades de compreensão e geração de contextos multimodais na etapa de pré-treinamento.
- Este design permite um desempenho excepcional ao seguir instruções multimodais complexas.