A MiniMax disponibilizou seu modelo MiniMax-H3 no Hugging Face. Este sistema generativo omnimodal de propósito geral suporta a compreensão unificada de contextos multimodais compostos por texto, imagens, vídeo e áudio.

  • Ele pode gerar vídeos com áudio estéreo nativo em resoluções de até 2K e durações de até 15 segundos.
  • O modelo possui amplas capacidades de compreensão e geração de contextos multimodais na etapa de pré-treinamento.
  • Este design permite um desempenho excepcional ao seguir instruções multimodais complexas.